vLLM V0 vers V1 : la correction avant les corrections en RL
PipelineRL a aligné vLLM V1 sur sa référence V0 après avoir corrigé quatre points.
PipelineRL a aligné vLLM V1 sur sa référence V0 après avoir corrigé quatre points.
Hugging Face a intégré des datasets audio privés d'Appen Inc. et DataoceanAI à l'Open ASR Leaderboard afin de limiter les risques de benchmaxxing et de contamination des jeux de test. Ces données couvrent de l'anglais scripté et conversationnel sur plusieurs accents (australien, canadien, indien, américain, britannique), avec des durées allant de 1,02 h à 8,82 h selon les splits. Le WER moyen par défaut reste calculé uniquement sur les datasets publics, un toggle permettant d'inclure les datasets privés ; les scores par split ne sont volontairement pas publiés pour éviter les optimisations ciblées.
IBM publie un descriptif technique détaillé de la construction des Granite 4.1, une famille de LLM denses decoder-only de 3B.
Motif de la recommandation :L'article détaille le pipeline de pré-entraînement en cinq phases et la recette RL de Granite 4.1, utile pour comprendre comment un dense 8B rivalise avec un MoE 32B.
DeepInfra devient un Inference Provider pris en charge sur le Hugging Face Hub.
OpenAI a publié cette semaine sur le Hub Privacy Filter.
DeepSeek a publié V4, avec deux checkpoints MoE sur le Hub : DeepSeek-V4-Pro (1.
Motif de la recommandation :L'article détaille l'architecture CSA/HCA et les choix de post-entraînement qui rendent l'inférence à 1M tokens exploitable pour les agents.
Le guide explique comment faire tourner une IA locale dans une extension Chrome sous Manifest V3 avec Transformers.js.
Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.
Hugging Face analyse les implications de Mythos, un « frontier AI model » capable de détecter et corriger des vulnérabilités logicielles au sein d'un système combinant puissance de calcul.
Hugging Face publie un Skill et un harnais de test pour aider les contributeurs à porter les modèles de transformers vers mlx-lm.
Motif de la recommandation :Le Skill et le harnais de test transforment le portage de modèles transformers vers mlx-lm en un processus reproductible, avec des règles concrètes pour des PR de qualité.
Hugging Face présente Ecom-RLVE, une extension du framework RLVE aux conversations e-commerce multi-tours avec outils.
Le blog Hugging Face explique comment entraîner ou affiner des modèles d'embedding et de reranker multimodaux avec la bibliothèque Sentence Transformers.
IBM Research présente VAKRA, un benchmark exécutable évaluant le raisonnement et l'action des agents dans des environnements d'entreprise.
HCompany lance HoloTab, une extension Chrome gratuite qui automatise des tâches sur n'importe quel site web sans configuration ni compétence technique.
Motif de la recommandation :HoloTab transforme le modèle computer-use Holo3 en extension Chrome gratuite, avec des routines enregistrées et rejouables, ce qui montre comment un agent navigue et agit dans le navigateur.
Overworld publie Waypoint-1.5, son nouveau modèle de monde vidéo temps réel.
Motif de la recommandation :L'original expose les paliers de résolution, la plage matérielle et les modes d'exécution locale, ce qui permet de juger de l'accessibilité réelle du modèle.
Sentence Transformers v5.4 permet d'encoder et de comparer textes, images, audio et vidéos via la même API.
Motif de la recommandation :La v5.4 de Sentence Transformers unifie texte, image, audio et vidéo dans une même API d'embedding et de reranking, avec la liste des modèles compatibles.
Safetensors, le format de stockage de poids de modèles créé par Hugging Face, rejoint la PyTorch Foundation en tant que projet hébergé par la Linux Foundation.
Google DeepMind publie sur Hugging Face la famille Gemma 4, des modèles multimodaux sous licence Apache 2.0 capables de traiter texte.
Motif de la recommandation :L'article détaille l'architecture, les tailles et les benchmarks de Gemma 4, ainsi que son intégration dans les principaux moteurs d'inférence et outils de fine-tuning.
Le Falcon Vision Team du Technology Innovation Institute (TII) d'Abu Dhabi publie Falcon Perception.
Motif de la recommandation :Falcon Perception et Falcon OCR adoptent une architecture Transformer à fusion précoce unique, avec des benchmarks détaillés et un code open source pour comparer les compromis de conception.
Hugging Face présente gradio.Server, une extension de FastAPI qui ajoute le moteur d'API de Gradio (file d'attente.
Motif de la recommandation :gradio.Server permet de conserver la file d'attente et le support ZeroGPU de Gradio tout en apportant son propre frontend, ce qui change la façon de construire sur Spaces.
IBM annonce Granite 4.0 3B Vision, un modèle vision-langage compact destiné à l'extraction d'informations dans les documents d'entreprise.
Motif de la recommandation :Le modèle compact et son adaptateur LoRA sont décrits avec les benchmarks de tableaux, graphiques et KVP, ce qui aide à juger son intérêt pour l'extraction documentaire.
OpenMed a entraîné CodonRoBERTa-large-v2, un modèle de langage au niveau des codons de 312M de paramètres.
Hugging Face a publié TRL v1.0, une bibliothèque de post-entraînement qui passe d'une base de code de recherche à une bibliothèque stable avec un contrat de versioning sémantique. Elle implémente plus de 75 méthodes de post-entraînement et adopte une structure où le noyau stable (SFT, DPO, Reward modeling, RLOO, GRPO) et la couche expérimentale (ORPO, etc.) coexistent avec des contrats distincts. La bibliothèque est téléchargée 3 millions de fois par mois et sert d'infrastructure à des projets comme Unsloth et Axolotl. Les prochaines étapes incluent un GRPO asynchrone, la stabilisation de KTO et de formateurs de distillation, ainsi que des avertissements structurés pour rendre l'entraînement lisible par les agents.
Motif de la recommandation :L'article détaille la conception de stabilité de TRL v1.0 et sa couverture de plus de 75 méthodes de post-entraînement, utile pour comprendre l'évolution des bibliothèques d'entraînement.
Anthropic restreint l'accès aux modèles Claude pour les abonnés Pro/Max sur les plateformes d'agents ouvertes.
Hugging Face a publié son analyse de l'écosystème open source au printemps 2026.
Motif de la recommandation :L'analyse quantifie la croissance de l'écosystème open source et le basculement de la Chine, offrant un contexte chiffré sur la répartition des usages.
H Company publie Holotron-12B, un modèle multimodal computer-use post-entraîné à partir du modèle ouvert NVIDIA Nemotron-Nano-2 VL sur des données propriétaires.
Motif de la recommandation :L'article détaille l'architecture SSM hybride et les chiffres de débit, utiles pour évaluer le déploiement d'agents computer-use à grande échelle.
Hugging Face a étudié 16 bibliothèques RL open source construites autour de l'entraînement asynchrone et les a comparées selon 7 axes.
Hugging Face annonce Storage Buckets, un stockage objet mutable de type S3 sur le Hub.
Motif de la recommandation :Hugging Face ajoute une couche de stockage objet mutable au Hub, avec déduplication Xet et préchauffage multi-cloud, ce qui éclaire l'organisation des artefacts d'entraînement.
Ulysses Sequence Parallelism, issu du protocole Arctic Long Sequence Training (ALST) de Snowflake AI Research.
LeRobot v0.5.0 est publié, avec plus de 200 PR fusionnées et plus de 50 nouveaux contributeurs depuis la v0.4.0. Cette version ajoute le support complet du robot humanoïde Unitree G1 (locomotion, manipulation, téléopération et contrôle corps entier), de nouvelles politiques comme Pi0-FAST (VLA autorégressif basé sur Gemma 300M) et Real-Time Chunking (RTC), ainsi que l'encodage vidéo en streaming qui supprime l'attente entre les épisodes d'enregistrement. La version introduit aussi EnvHub pour charger des environnements de simulation depuis le Hugging Face Hub, l'intégration de NVIDIA IsaacLab-Arena, et modernise la base de code avec Python 3.12+ et Transformers v5.
Motif de la recommandation :LeRobot v0.5.0 détaille l'ajout du support du robot humanoïde Unitree G1 et de nouvelles politiques VLA, utile pour suivre l'évolution des frameworks robotiques open source.
NXP détaille ses bonnes pratiques pour enregistrer des datasets robotiques.
Hugging Face présente Modular Diffusers, une nouvelle façon de construire des pipelines de diffusion en composant des blocs réutilisables.
Motif de la recommandation :L'article détaille la composition par blocs des pipelines de diffusion et l'intégration avec Mellon, ce qui permet de juger de la flexibilité offerte pour construire des workflows personnalisés.
Photoroom publie le troisième volet de sa série PRX, consacré à un speedrun d'entraînement d'un modèle text-to-image en 24 heures sur 32 H200.
Motif de la recommandation :L'article détaille la recette complète d'un entraînement text-to-image en 24h sur 32 H200 pour environ 1500 dollars, avec code open source.
Hugging Face détaille dans un article de blog les évolutions de la bibliothèque transformers pour prendre en charge les modèles Mixture of Experts (MoE).
Motif de la recommandation :L'article détaille les modifications d'ingénierie de transformers pour les MoE, avec des benchmarks de chargement et des API concrètes pour le déploiement.
Hugging Face annonce que GGML, créateur de llama.cpp.
Motif de la recommandation :L'annonce précise le maintien de l'autonomie de llama.cpp et les axes d'intégration avec transformers, utile pour suivre l'évolution de l'inférence locale.
Hugging Face propose des crédits gratuits pour fine-tuner des LLM avec Unsloth sur Hugging Face Jobs.
Gradio 6 permet désormais à gr.HTML de prendre en charge les templates personnalisés.
Hugging Face a construit un skill d'agent qui apprend aux agents de codage à écrire des kernels CUDA de production.
Motif de la recommandation :L'article détaille un skill d'agent qui génère des kernels CUDA intégrés à transformers et diffusers, avec benchmarks et procédure de publication sur le Hub.
Hugging Face et Meta présentent OpenEnv, un framework open source qui évalue les agents IA contre de vrais systèmes plutôt que des simulations.
Motif de la recommandation :L'article détaille le framework OpenEnv et le benchmark Calendar Gym, avec des chiffres concrets sur les limites des agents et des cas d'erreur d'appel d'outils réutilisables.
Transformers.js v4 est disponible sur NPM après un an de développement. La version adopte un nouveau runtime WebGPU réécrit en C++ avec l'équipe ONNX Runtime.
Motif de la recommandation :Transformers.js v4 détaille le nouveau runtime WebGPU en C++, les gains de performance et la restructuration du dépôt, utile pour évaluer le déploiement d'inférence dans le navigateur.