Aller au contenu
16 juilletmar.
  1. Mistral AI62

    Mistral AI publie Mathstral, un modèle 7B spécialisé en mathématiques et STEM

    Mistral AI publie Mathstral, un modèle instructif 7B spécialisé dans les problèmes mathématiques et STEM à raisonnement logique multi-étapes.

    Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.

27 juinjeu.
29 maimer.
24 maiven.
14 maimar.
  1. Hugging Face Blog73

    Google publie PaliGemma, une famille de modèles vision-langage open source

    Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.

    Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.

29 avrillun.
  1. Hugging Face Blog65

    StarCoder2-15B-Instruct : un modèle de code auto-aligné entièrement transparent et permissif

    Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.

    Motif de la recommandation :Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.

18 avriljeu.
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B.

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

15 avrillun.
  1. Hugging Face Blog72

    Hugging Face publie Idefics2, un modèle multimodal ouvert de 8B paramètres

    Hugging Face publie Idefics2, un modèle multimodal généraliste de 8B paramètres sous licence Apache 2.0.

    Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.

9 avrilmar.
26 févrierlun.
21 févriermer.
4 janvierjeu.
  1. Hugging Face Blog62

    Hugging Face publie aMUSEd, un modèle de génération d'images texte-image non-diffusion

    Hugging Face a publié aMUSEd, un modèle de génération d'images texte-image efficace non-diffusion.

    Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.

11 décembrelun.
  1. Mistral AI88

    Mistral AI publie Mixtral 8x7B, un modèle MoE à poids ouverts

    Mistral AI publie Mixtral 8x7B, un modèle à mélange d'experts clairsemé (SMoE) à poids ouverts sous licence Apache 2.0. Il surpasse Llama 2 70B sur la plupart des benchmarks avec une inférence 6 fois plus rapide, égale ou dépasse GPT3.5 sur la plupart des benchmarks standards, gère un contexte de 32k tokens et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Le modèle compte 46,7B paramètres au total mais n'en utilise que 12,9B par token, et Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench. Mistral AI a soumis des modifications à vLLM intégrant les kernels CUDA Megablocks, et Skypilot permet le déploiement des endpoints vLLM sur n'importe quelle instance cloud.

    Motif de la recommandation :L'original expose l'architecture MoE, les performances comparées et la pile de déploiement open source, ce qui permet de juger le compromis coût/performance.

  2. Hugging Face Blog85

    Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA

    Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.

    Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.

27 septembremer.
13 septembremer.
  1. Hugging Face Blog72

    Würstchen : un modèle de diffusion rapide pour la génération d'images

    Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.

    Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.

6 septembremer.
  1. Hugging Face Blog83

    Hugging Face accueille Falcon 180B, le plus grand modèle ouvert avec 180 milliards de paramètres

    Le Falcon 180B de TII rejoint Hugging Face Hub, avec 180 milliards de paramètres entraînés sur 3.

    Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.

25 aoûtven.
  1. Hugging Face Blog88

    Code Llama : Llama 2 apprend à coder

    Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code.

    Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.

1 aoûtmar.
18 juilletmar.
  1. Hugging Face Blog88

    Llama 2 est disponible sur Hugging Face

    Meta publie Llama 2, une famille de grands modèles de langage open access de 7B à 70B paramètres.

    Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.

5 juinlun.
4 maijeu.
6 marslun.
  1. Hugging Face Blog65

    Kakao Brain publie les modèles ViT et ALIGN et le jeu de données COYO

    Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.

    Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.