Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.
Motif de la recommandation :L'article détaille les choix techniques de Gemma 2 et son intégration dans l'écosystème Hugging Face, utile pour évaluer les compromis de déploiement.
Motif de la recommandation :Codestral est un modèle de code open-weight de 22B avec une fenêtre de contexte de 32k, ce qui permet d'évaluer ses performances et son intégration dans les outils de développement.
Motif de la recommandation :Mistral AI introduit la MNPL et publie Codestral sous cette licence, ce qui permet de comprendre comment un laboratoire concilie ouverture et modèle économique.
Motif de la recommandation :Falcon 2 11B est publié en version LLM et VLM, avec les détails d'entraînement et les résultats d'évaluation pour situer ses performances.
Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.
Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.
Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.
Motif de la recommandation :Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.
Motif de la recommandation :L'article détaille les trois variantes de CodeGemma, leurs formats de prompt et les résultats sur HumanEval, ce qui aide à évaluer l'usage en complétion de code.
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Motif de la recommandation :L'article détaille l'intégration complète de Gemma dans l'écosystème Hugging Face, du déploiement à l'affinage, avec des exemples de code exécutables.
Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.
Mistral AI publie Mixtral 8x7B, un modèle à mélange d'experts clairsemé (SMoE) à poids ouverts sous licence Apache 2.0. Il surpasse Llama 2 70B sur la plupart des benchmarks avec une inférence 6 fois plus rapide, égale ou dépasse GPT3.5 sur la plupart des benchmarks standards, gère un contexte de 32k tokens et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Le modèle compte 46,7B paramètres au total mais n'en utilise que 12,9B par token, et Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench. Mistral AI a soumis des modifications à vLLM intégrant les kernels CUDA Megablocks, et Skypilot permet le déploiement des endpoints vLLM sur n'importe quelle instance cloud.
Motif de la recommandation :L'original expose l'architecture MoE, les performances comparées et la pile de déploiement open source, ce qui permet de juger le compromis coût/performance.
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Motif de la recommandation :Mistral AI expose sa position sur les modèles ouverts et publie Mistral 7B sous Apache 2.0, avec des repères de performance sur les benchmarks standards.
Motif de la recommandation :Mistral 7B est publié sous licence Apache 2.0 avec des comparaisons détaillées face à Llama 2 et des optimisations d'inférence, ce qui permet de juger du compromis coût-performance.
Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.
Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.
Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.
Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.
Motif de la recommandation :L'article détaille la méthode de distillation par suppression de blocs et publie le code et les poids, ce qui permet de reproduire et d'adapter ces modèles compressés.
Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.
Motif de la recommandation :L'article détaille l'intégration de Falcon dans l'écosystème Hugging Face, avec des exemples d'inférence, de quantification et de fine-tuning directement réutilisables.
Motif de la recommandation :StarCoder est publié avec ses poids, sa licence et ses benchmarks, ce qui permet de comparer directement ses performances à celles des modèles ouverts et fermés.
Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.
Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.