Aller au contenu

Orientations techniques

Écosystème open source Dernières actualités

L'actualité des modèles, frameworks et dépôts open source : ouverture des poids, succès fulgurants des projets communautaires, rapport de force entre open source et modèles fermés.

228 sélections30 derniers jours 15 entréesTotal : 438 entrées

mise à jour

Archives de la sélection · page 8

17 septembremar.141–160 entrées
13 septembreven.
  1. Hugging Face Blog62

    Hugging Face publie la première release candidate d'Accelerate 1.0.0

    Hugging Face a publié la première release candidate d'Accelerate 1.0.0, une bibliothèque d'entraînement distribué utilisée par transformers.

    Motif de la recommandation :L'annonce détaille les changements cassants et les nouvelles intégrations de la version 1.0.0, ce qui aide les utilisateurs à évaluer la migration.

12 aoûtlun.
  1. Hugging Face Blog78

    Falcon Mamba : le premier modèle 7B sans attention de TII

    Le Technology Innovation Institute (TII) d'Abu Dhabi publie Falcon Mamba 7B, présenté comme le premier grand modèle 7B sans attention.

    Motif de la recommandation :L'article détaille l'architecture sans attention, les benchmarks comparatifs et le support dans l'écosystème Hugging Face, utile pour évaluer les compromis des SSM.

8 aoûtjeu.
7 aoûtmer.
  1. Mistral AI60

    Mistral AI annonce la personnalisation de modèles, les Agents en alpha et le SDK mistralai 1.0

    Mistral AI annonce la possibilité de personnaliser n'importe lequel de ses modèles phares et spécialisés sur La Plateforme.

    Motif de la recommandation :Mistral AI expose en détail la personnalisation de modèles, les Agents en alpha et le SDK 1.0, ce qui permet de juger des changements concrets pour les développeurs.

31 juilletmer.
23 juilletmar.
18 juilletjeu.
  1. Mistral AI78

    Mistral AI publie Mistral NeMo, un modèle 12B avec une fenêtre de contexte de 128k

    Mistral AI publie Mistral NeMo, un modèle 12B développé en collaboration avec NVIDIA.

    Motif de la recommandation :Mistral NeMo est un modèle 12B à fenêtre de 128k, sous licence Apache 2.0, avec un tokenizer Tekken plus efficace et une quantification FP8, ce qui permet d'évaluer les compromis entre taille, contexte et coût d'inférence.

16 juilletmar.
  1. Mistral AI78

    Mistral AI publie Codestral Mamba, un modèle de code basé sur l'architecture Mamba

    Mistral AI publie Codestral Mamba, un modèle de code sous licence Apache 2.0 conçu avec Albert Gu et Tri Dao.

    Motif de la recommandation :Codestral Mamba adopte l'architecture Mamba avec une inférence en temps linéaire et un contexte testé jusqu'à 256k tokens, un point de repère pour évaluer les alternatives aux Transformer sur le code.

  2. Mistral AI62

    Mistral AI publie Mathstral, un modèle 7B spécialisé en mathématiques et STEM

    Mistral AI publie Mathstral, un modèle instructif 7B spécialisé dans les problèmes mathématiques et STEM à raisonnement logique multi-étapes.

    Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.

11 juilletjeu.
  1. Hugging Face Blog67

    Comment NuminaMath a remporté le 1er AIMO Progress Prize

    Numina et Hugging Face ont remporté le 1er Progress Prize de l'AI Math Olympiad (AIMO) avec NuminaMath 7B TIR.

    Motif de la recommandation :L'article détaille la recette d'entraînement en deux étapes et l'algorithme SC-TIR qui ont permis de résoudre 29 problèmes sur 50, une méthode transférable pour le fine-tuning d'un modèle de raisonnement mathématique.

10 juilletmer.
  1. Hugging Face Blog60

    Hugging Face et KerasHub annoncent une intégration : les modèles Transformers peuvent être chargés directement dans KerasHub

    Hugging Face et KerasHub annoncent une intégration : Transformers et KerasHub partagent désormais un format de sauvegarde de modèles.

    Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.

1 juilletlun.
27 juinjeu.
12 juinmer.
  1. Hugging Face Blog78

    Diffusers accueille Stable Diffusion 3 Medium avec optimisations mémoire et scripts LoRA

    Stable Diffusion 3 Medium (2B paramètres) de Stability AI est disponible sur le Hugging Face Hub et utilisable avec Diffusers. Le modèle repose sur une architecture MMDiT avec trois encodeurs de texte (CLIP L/14, OpenCLIP bigG/14, T5-v1.1-XXL) et un autoencodeur 16 canaux, entraîné avec un objectif de rectified flow matching. L'intégration Diffusers inclut des optimisations mémoire (offloading CPU, suppression de l'encodeur T5, quantification 8 bits via bitsandbytes) permettant de réduire la consommation de 18,7 Go à 4,3 Go, ainsi que des scripts de fine-tuning DreamBooth et LoRA.

    Motif de la recommandation :Le billet détaille l'intégration de SD3 Medium dans Diffusers, avec optimisations mémoire et scripts de fine-tuning LoRA directement réutilisables.

5 juinmer.
29 maimer.