Aller au contenu
12 aoûtlun.
  1. Hugging Face Blog78

    Falcon Mamba : le premier modèle 7B sans attention de TII

    Le Technology Innovation Institute (TII) d'Abu Dhabi publie Falcon Mamba 7B, présenté comme le premier grand modèle 7B sans attention.

    Motif de la recommandation :L'article détaille l'architecture sans attention, les benchmarks comparatifs et le support dans l'écosystème Hugging Face, utile pour évaluer les compromis des SSM.

8 aoûtjeu.
6 aoûtmar.
30 juilletmar.
  1. Hugging Face Blog60

    Comment réduire la mémoire des Diffusion Transformers avec Quanto et Diffusers

    Hugging Face présente comment quantifier les pipelines de diffusion basés sur Transformer avec les utilitaires Quanto de la bibliothèque Diffusers.

    Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.

29 juilletlun.
25 juilletjeu.
23 juilletmar.
22 juilletlun.
18 juilletjeu.
16 juilletmar.
  1. Mistral AI78

    Mistral AI publie Codestral Mamba, un modèle de code basé sur l'architecture Mamba

    Mistral AI publie Codestral Mamba, un modèle de code sous licence Apache 2.0 conçu avec Albert Gu et Tri Dao.

    Motif de la recommandation :Codestral Mamba adopte l'architecture Mamba avec une inférence en temps linéaire et un contexte testé jusqu'à 256k tokens, un point de repère pour évaluer les alternatives aux Transformer sur le code.

  2. Mistral AI62

    Mistral AI publie Mathstral, un modèle 7B spécialisé en mathématiques et STEM

    Mistral AI publie Mathstral, un modèle instructif 7B spécialisé dans les problèmes mathématiques et STEM à raisonnement logique multi-étapes.

    Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.

  3. Hugging Face Blog34

    Comment utiliser distilabel pour créer un chatbot Argilla 2.0

    Hugging Face détaille la création d'un chatbot pour Argilla 2.0 en s'appuyant sur distilabel pour générer un dataset synthétique et fine-tuner un modèle d'embedding spécialisé. Le processus couvre le chunking de la documentation technique (environ 256 tokens par chunk), la génération de questions synthétiques et d'exemples négatifs difficiles, la création d'une base vectorielle et le déploiement du chatbot sur Hugging Face Spaces. Les interactions sont stockées dans Argilla pour une évaluation et une amélioration continues.

11 juilletjeu.
  1. Hugging Face Blog67

    Comment NuminaMath a remporté le 1er AIMO Progress Prize

    Numina et Hugging Face ont remporté le 1er Progress Prize de l'AI Math Olympiad (AIMO) avec NuminaMath 7B TIR.

    Motif de la recommandation :L'article détaille la recette d'entraînement en deux étapes et l'algorithme SC-TIR qui ont permis de résoudre 29 problèmes sur 50, une méthode transférable pour le fine-tuning d'un modèle de raisonnement mathématique.

10 juilletmer.
  1. Hugging Face Blog60

    Hugging Face et KerasHub annoncent une intégration : les modèles Transformers peuvent être chargés directement dans KerasHub

    Hugging Face et KerasHub annoncent une intégration : Transformers et KerasHub partagent désormais un format de sauvegarde de modèles.

    Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.

9 juilletmar.
  1. Hugging Face Blog22

    Banque des Territoires (groupe CDC) x Polyconseil x Hugging Face : une solution data souveraine pour le programme environnemental EduRénov

    Banque des Territoires (groupe CDC), Polyconseil et Hugging Face ont achevé la première phase d'une solution RAG souveraine destinée à optimiser l'accompagnement du programme EduRénov de rénovation écologique de 10 000 bâtiments scolaires publics. Le dispositif vise 40 % d'économies d'énergie en 5 ans, avec 2 milliards d'euros de prêts et 50 millions d'euros d'ingénierie préparatoire. Après un an, près de 2 000 projets ont été signés, et le CDC a imposé la souveraineté des services de calcul et des modèles, en s'appuyant notamment sur Text Generation Inference, Transformers, Sentence Transformers et Tokenizers de Hugging Face.

3 juilletmer.
1 juilletlun.
27 juinjeu.
25 juinmar.
24 juinlun.
18 juinmar.
13 juinjeu.
12 juinmer.
  1. Hugging Face Blog78

    Diffusers accueille Stable Diffusion 3 Medium avec optimisations mémoire et scripts LoRA

    Stable Diffusion 3 Medium (2B paramètres) de Stability AI est disponible sur le Hugging Face Hub et utilisable avec Diffusers. Le modèle repose sur une architecture MMDiT avec trois encodeurs de texte (CLIP L/14, OpenCLIP bigG/14, T5-v1.1-XXL) et un autoencodeur 16 canaux, entraîné avec un objectif de rectified flow matching. L'intégration Diffusers inclut des optimisations mémoire (offloading CPU, suppression de l'encodeur T5, quantification 8 bits via bitsandbytes) permettant de réduire la consommation de 18,7 Go à 4,3 Go, ainsi que des scripts de fine-tuning DreamBooth et LoRA.

    Motif de la recommandation :Le billet détaille l'intégration de SD3 Medium dans Diffusers, avec optimisations mémoire et scripts de fine-tuning LoRA directement réutilisables.

7 juinven.
6 juinjeu.
4 juinmar.
29 maimer.
28 maimar.
24 maiven.
22 maimer.
21 maimar.