Microsoft Research publie une étude systématique montrant que déporter l'inférence d'IA physique hors du robot.
Motif de la recommandation :L'étude quantifie les gains de déport de l'inférence sur la réussite des tâches et l'autonomie des robots, avec un outillage Kubernetes open source associé.
NVIDIA publie Isaac ROS 5.0, une collection de paquets accélérés par GPU bâtie sur ROS。
Motif de la recommandation :NVIDIA détaille les workflows agentiques et le support de ROS Lyrical dans Isaac ROS 5.0, ce qui permet de situer les changements pour les développeurs robotiques.
Google DeepMind lance Gemini Robotics ER 2, présenté comme son modèle de raisonnement incarné le plus capable pour la robotique。
Motif de la recommandation :L'original expose les capacités d'orchestration, de suivi de progression et de collaboration multi-robots, ainsi que les points d'accès ouverts aux développeurs.
Google DeepMind présente Gemini Robotics 2, une couche d'intelligence pour robots qui débloque le contrôle corps entier。
Motif de la recommandation :Google DeepMind détaille trois modèles distincts et leurs capacités de contrôle corps entier, de dextérité et de collaboration multi-robots, avec les modalités d'accès pour les développeurs.
Hugging Face et Pollen Robotics publient Grabette, un système ouvert et à faible coût pour enregistrer des données de manipulation 。
Motif de la recommandation :Le système complet est ouvert, du boîtier à la chaîne de traitement, ce qui permet de juger du coût et des étapes pour collecter soi-même des données de manipulation.
Mistral AI présente Robostral Navigate, un modèle 8B de navigation incarnée qui utilise uniquement une caméra RGB et une instruction en langage naturel pour déplacer un robot dans des environnements complexes. Il atteint 76,6 % de réussite sur R2R-CE validation unseen, soit 9,7 points de plus que la meilleure approche à caméra unique et 4,5 points de plus que le meilleur système utilisant profondeur ou plusieurs caméras. Le modèle est entraîné entièrement en simulation sur environ 2,4 millions de trajectoires issues de 350k scènes, avec une méthode de prefix-caching qui réduit de 22× le nombre de tokens d'entraînement, puis un apprentissage par renforcement en ligne CISPO qui améliore le taux de réussite de 3,2 %. Il fonctionne sur robots à roues, à pattes et volants, et s'adapte à des obstacles réels non vus à l'entraînement.
Motif de la recommandation :Un modèle de navigation incarnée de 8B qui atteint 76,6 % sur R2R-CE avec une seule caméra RGB, avec les détails d'entraînement et de RL.
LeRobot v0.6.0 introduit des politiques à modèle du monde (VLA-JEPA, FastWAM, LingBot-VA)。
Motif de la recommandation :LeRobot v0.6.0 expose en détail les nouveaux modèles, benchmarks et outils de déploiement, ce qui permet de juger l'évolution de la boucle d'apprentissage robotique open source.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
Mistral AI a conclu un accord définitif pour acquérir Emmi AI, pionnier autrichien du Physics AI。
Motif de la recommandation :Mistral acquiert Emmi AI pour intégrer la physique dans ses modèles et ses agents d'ingénierie, un signal sur la convergence entre IA et industrie.
Google DeepMind ajoute à Project Genie une capacité d'ancrage sur les images réelles de Google Street View。
Motif de la recommandation :L'original expose une nouvelle capacité de génération de mondes ancrée dans Street View et son ouverture aux abonnés Google AI Ultra, ce qui permet de juger de son usage pour les agents et la simulation.
Google DeepMind lance Gemini Robotics-ER 1.6, une mise à niveau de son modèle de raisonnement pour la robotique qui renforce le raisonnement spatial et la compréhension multi-vues. Le modèle progresse sur le pointage, le comptage et la détection de succès par rapport à Gemini Robotics-ER 1.5 et Gemini 3.0 Flash, et ajoute la lecture d'instruments comme les manomètres et voyants de niveau, développée avec Boston Dynamics. Il est disponible dès aujourd'hui via la Gemini API et Google AI Studio, avec un Colab de démonstration.
Motif de la recommandation :Présentation des capacités de raisonnement incarné et de la lecture d'instruments, avec comparaison des performances et accès développeur via API.
LeRobot v0.5.0 est publié, avec plus de 200 PR fusionnées et plus de 50 nouveaux contributeurs depuis la v0.4.0. Cette version ajoute le support complet du robot humanoïde Unitree G1 (locomotion, manipulation, téléopération et contrôle corps entier), de nouvelles politiques comme Pi0-FAST (VLA autorégressif basé sur Gemma 300M) et Real-Time Chunking (RTC), ainsi que l'encodage vidéo en streaming qui supprime l'attente entre les épisodes d'enregistrement. La version introduit aussi EnvHub pour charger des environnements de simulation depuis le Hugging Face Hub, l'intégration de NVIDIA IsaacLab-Arena, et modernise la base de code avec Python 3.12+ et Transformers v5.
Motif de la recommandation :LeRobot v0.5.0 détaille l'ajout du support du robot humanoïde Unitree G1 et de nouvelles politiques VLA, utile pour suivre l'évolution des frameworks robotiques open source.
NVIDIA a publié Cosmos Reason 2, un modèle de vision-langage de raisonnement ouvert destiné à l'IA physique。
Motif de la recommandation :NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique, avec des tailles 2B et 8B et un contexte de 256K.
NVIDIA publie un tutoriel pas à pas pour construire un assistant personnel de bureau combinant DGX Spark et Reachy Mini。
Motif de la recommandation :Un guide pas à pas pour assembler un assistant de bureau avec DGX Spark et Reachy Mini, utile à ceux qui veulent reproduire un agent multimodal local.
OpenAI indique avoir créé un système robotique entraîné entièrement en simulation et déployé sur un robot physique, capable d'apprendre une nouvelle tâche après l'avoir vue réalisée une fois.