Aller au contenu
  1. Google DeepMind85

    Google DeepMind lance Gemini Robotics 2 pour le contrôle corps entier des robots

    Google DeepMind présente Gemini Robotics 2, une couche d'intelligence pour robots qui débloque le contrôle corps entier。

    Motif de la recommandation :Google DeepMind détaille trois modèles distincts et leurs capacités de contrôle corps entier, de dextérité et de collaboration multi-robots, avec les modalités d'accès pour les développeurs.

  1. Hugging Face Blog62

    Hugging Face et Pollen Robotics publient Grabette, un système ouvert de collecte de données de manipulation robotique

    Hugging Face et Pollen Robotics publient Grabette, un système ouvert et à faible coût pour enregistrer des données de manipulation 。

    Motif de la recommandation :Le système complet est ouvert, du boîtier à la chaîne de traitement, ce qui permet de juger du coût et des étapes pour collecter soi-même des données de manipulation.

  1. Mistral AI67

    Mistral AI lance Robostral Navigate, un modèle 8B de navigation incarnée

    Mistral AI présente Robostral Navigate, un modèle 8B de navigation incarnée qui utilise uniquement une caméra RGB et une instruction en langage naturel pour déplacer un robot dans des environnements complexes. Il atteint 76,6 % de réussite sur R2R-CE validation unseen, soit 9,7 points de plus que la meilleure approche à caméra unique et 4,5 points de plus que le meilleur système utilisant profondeur ou plusieurs caméras. Le modèle est entraîné entièrement en simulation sur environ 2,4 millions de trajectoires issues de 350k scènes, avec une méthode de prefix-caching qui réduit de 22× le nombre de tokens d'entraînement, puis un apprentissage par renforcement en ligne CISPO qui améliore le taux de réussite de 3,2 %. Il fonctionne sur robots à roues, à pattes et volants, et s'adapte à des obstacles réels non vus à l'entraînement.

    Motif de la recommandation :Un modèle de navigation incarnée de 8B qui atteint 76,6 % sur R2R-CE avec une seule caméra RGB, avec les détails d'entraînement et de RL.

  1. Hugging Face Blog78

    LeRobot v0.6.0 : imaginer, évaluer, améliorer la boucle d'apprentissage robotique

    LeRobot v0.6.0 introduit des politiques à modèle du monde (VLA-JEPA, FastWAM, LingBot-VA)。

    Motif de la recommandation :LeRobot v0.6.0 expose en détail les nouveaux modèles, benchmarks et outils de déploiement, ce qui permet de juger l'évolution de la boucle d'apprentissage robotique open source.

  1. Hugging Face Blog62

    AWS Strands Robots : du Hub Hugging Face au robot physique avec LeRobot

    AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。

    Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.

  1. Mistral AI62

    Mistral AI acquiert Emmi AI pour accélérer l'IA industrielle

    Mistral AI a conclu un accord définitif pour acquérir Emmi AI, pionnier autrichien du Physics AI。

    Motif de la recommandation :Mistral acquiert Emmi AI pour intégrer la physique dans ses modèles et ses agents d'ingénierie, un signal sur la convergence entre IA et industrie.

  1. Google DeepMind62

    Project Genie de Google DeepMind intègre Street View pour générer des mondes ancrés dans des lieux réels

    Google DeepMind ajoute à Project Genie une capacité d'ancrage sur les images réelles de Google Street View。

    Motif de la recommandation :L'original expose une nouvelle capacité de génération de mondes ancrée dans Street View et son ouverture aux abonnés Google AI Ultra, ce qui permet de juger de son usage pour les agents et la simulation.

  1. Google DeepMind76

    Google DeepMind lance Gemini Robotics-ER 1.6, axé sur le raisonnement incarné

    Google DeepMind lance Gemini Robotics-ER 1.6, une mise à niveau de son modèle de raisonnement pour la robotique qui renforce le raisonnement spatial et la compréhension multi-vues. Le modèle progresse sur le pointage, le comptage et la détection de succès par rapport à Gemini Robotics-ER 1.5 et Gemini 3.0 Flash, et ajoute la lecture d'instruments comme les manomètres et voyants de niveau, développée avec Boston Dynamics. Il est disponible dès aujourd'hui via la Gemini API et Google AI Studio, avec un Colab de démonstration.

    Motif de la recommandation :Présentation des capacités de raisonnement incarné et de la lecture d'instruments, avec comparaison des performances et accès développeur via API.

  1. Hugging Face Blog75

    LeRobot v0.5.0 est publié, avec le support du robot humanoïde Unitree G1 et de nouvelles politiques VLA

    LeRobot v0.5.0 est publié, avec plus de 200 PR fusionnées et plus de 50 nouveaux contributeurs depuis la v0.4.0. Cette version ajoute le support complet du robot humanoïde Unitree G1 (locomotion, manipulation, téléopération et contrôle corps entier), de nouvelles politiques comme Pi0-FAST (VLA autorégressif basé sur Gemma 300M) et Real-Time Chunking (RTC), ainsi que l'encodage vidéo en streaming qui supprime l'attente entre les épisodes d'enregistrement. La version introduit aussi EnvHub pour charger des environnements de simulation depuis le Hugging Face Hub, l'intégration de NVIDIA IsaacLab-Arena, et modernise la base de code avec Python 3.12+ et Transformers v5.

    Motif de la recommandation :LeRobot v0.5.0 détaille l'ajout du support du robot humanoïde Unitree G1 et de nouvelles politiques VLA, utile pour suivre l'évolution des frameworks robotiques open source.

  1. Hugging Face Blog71

    NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique

    NVIDIA a publié Cosmos Reason 2, un modèle de vision-langage de raisonnement ouvert destiné à l'IA physique。

    Motif de la recommandation :NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique, avec des tailles 2B et 8B et un contexte de 256K.

  1. OpenAI News78

    OpenAI 用机械手解魔方

    OpenAI 训练了一对神经网络, 让类人机械手解开魔方. 神经网络完全在模拟环境中训练, 使用与 OpenAI Five 相同的强化学习代码, 并搭配名为 Automatic Domain Randomization (ADR) 的新技术. 该系统能处理训练中从未见过的情况。

    Motif de la recommandation :展示了纯模拟训练的策略如何迁移到真实机械手, 并应对训练中未见的干扰, 对具身智能研究有参考价值.

Fin de la liste