Motif de la recommandation :L'article détaille une couche de traduction CUDA vers MLX et les gains mesurés sur les kernels Attention et Mamba, utile pour évaluer la portabilité des optimisations GPU.
Diffusers prend désormais en charge nativement les checkpoints Nunchaku Lite : il suffit d'appeler from_pretrained() pour charger un modèle quantifié en 4 bits。
Motif de la recommandation :L'intégration native de Nunchaku Lite dans Diffusers permet de charger des checkpoints 4 bits avec from_pretrained() et de quantifier de nouvelles architectures via diffuse-compressor.
Motif de la recommandation :Le récit détaillé d'une intrusion menée par un agent autonome et des moyens de détection par LLM offre un retour d'expérience concret sur la défense des plateformes IA.
Le backend de modélisation transformers pour vLLM atteint désormais une vitesse égale ou supérieure aux implémentations natives de vLLM pour de nombreuses architectures LLM。
Motif de la recommandation :L'article détaille comment le backend transformers atteint la vitesse native de vLLM et ce que cela change pour le déploiement des modèles.
Motif de la recommandation :Présente le catalogue Hugging Face sur Foundry Managed Compute et le pipeline de curation, utile pour évaluer le déploiement de modèles open-weight en entreprise.
Motif de la recommandation :Le montage hf:// et l'absence de frais de sortie permettent de lancer l'entraînement sur n'importe quel cloud sans copier les données.
Motif de la recommandation :Le billet détaille le nouveau type de dépôt kernel, la signature de code et les CLI repensées, ce qui aide à juger comment distribuer et sécuriser des kernels personnalisés.
Motif de la recommandation :L'original expose une architecture vocale ouverte et modulaire avec les composants et le point d'accès au code, ce qui permet de juger comment assembler un pipeline speech-to-speech temps réel.
Hugging Face fait passer la publication de huggingface_hub d'un rythme de 4 à 6 semaines à une fois par semaine via un unique workflow GitHub Actions. La chaîne combine OpenCode。
Motif de la recommandation :Le texte détaille une chaîne CI de publication hebdomadaire avec garde-fous déterministes et relecture humaine, une méthode transférable à d'autres bibliothèques Python.
L'équipe Chrome de Google expérimente la Cross-Origin Storage API (COS) dans Transformers.js pour éliminer les téléchargements et stockages dupliqués de ressources de modèles et de runtimes Wasm entre origines. Le cache navigateur étant isolé par origine via une Network Isolation Key, un même modèle comme Xenova/whisper-tiny.en peut être retéléchargé (177 MB dans l'exemple) sur chaque site, et le fichier Wasm partagé ort-wasm-simd-threaded.asyncify.wasm (4 733 kB) est lui aussi rechargé. L'API COS, encore à l'état de proposition non finalisée et non implémentée nativement, identifie les fichiers par hash cryptographique plutôt que par URL, et peut être testée via une extension injectant le polyfill navigator.crossOriginStorage.
L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.
Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.
Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
Motif de la recommandation :L'original détaille la spécification ARD et son implémentation de référence sur le Hub, ce qui permet de comprendre comment la découverte de capacités se sépare de l'exécution.
Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.
Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.
Motif de la recommandation :L'article détaille la refonte du CLI hf pour les agents et publie un benchmark comparant consommation de tokens et taux de réussite face à curl et au SDK Python.
Motif de la recommandation :Mistral détaille sa pile IA industrielle et son agent Vibe, avec des partenariats Airbus, BMW et ASML et un centre de données en France, ce qui éclaire le positionnement entreprise.
Mistral AI publie en aperçu public Search Toolkit, un cadre composable et open source pour construire des pipelines de recherche destinés aux applications IA。
Motif de la recommandation :Un cadre unifié d'ingestion, de récupération et d'évaluation, open source et déployable sur site, qui permet de comparer les configurations de recherche sur ses propres données.
Mistral annonce l'intégration d'Emmi AI et le lancement d'une nouvelle capacité d'IA physique au sein de ses solutions d'entreprise pour l'ingénierie industrielle native en IA. Cette approche apprend des sorties de solveurs physiques pour prédire le comportement physique directement à partir de la géométrie et des conditions aux limites, en un seul passage avant sur un GPU, de l'ordre de la seconde, contre des heures à des semaines de calcul par variante de conception avec les méthodes traditionnelles. Mistral cite comme partenaires ASML, Airbus, Safran et Siemens Energy, et indique que cette capacité s'applique à l'aérospatiale, l'automobile, l'électronique et les semi-conducteurs, l'énergie et les équipements industriels.
Motif de la recommandation :Mistral intègre Emmi AI et présente l'IA physique comme une capacité d'ingénierie industrielle au sein de sa plateforme d'entreprise.
Google DeepMind lance de nouveaux programmes à Singapour dans le cadre de son initiative National Partnerships for AI et du partenariat national de Google avec le gouvernement singapourien. Le partenariat couvre la santé et les sciences de la vie (AI co-clinician, AlphaFold, Google Earth, un assistant de course basé sur Gemma pour les athlètes aveugles ou malvoyants), la formation de chercheurs aux outils agentiques comme Hypothesis Generation construit avec Co-Scientist, et la fourniture de Gemini for Education à tous les enseignants, du primaire au lycée. Google DeepMind lance également en Asie-Pacifique l'accélérateur « AI for the Planet » et collabore avec l'IMDA et MLCommons sur des benchmarks de sécurité multimodaux et multilingues.
Motif de la recommandation :L'article détaille le pipeline de pré-entraînement en cinq phases et la recette RL de Granite 4.1, utile pour comprendre comment un dense 8B rivalise avec un MoE 32B.
Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.
Hugging Face analyse les implications de Mythos, un « frontier AI model » capable de détecter et corriger des vulnérabilités logicielles au sein d'un système combinant puissance de calcul。