Aller au contenu
  1. Google DeepMind85

    Google DeepMind lance Gemini Robotics 2 pour le contrôle corps entier des robots

    Google DeepMind présente Gemini Robotics 2, une couche d'intelligence pour robots qui débloque le contrôle corps entier。

    Motif de la recommandation :Google DeepMind détaille trois modèles distincts et leurs capacités de contrôle corps entier, de dextérité et de collaboration multi-robots, avec les modalités d'accès pour les développeurs.

  1. Mistral AI67

    Mistral AI lance Robostral Navigate, un modèle 8B de navigation incarnée

    Mistral AI présente Robostral Navigate, un modèle 8B de navigation incarnée qui utilise uniquement une caméra RGB et une instruction en langage naturel pour déplacer un robot dans des environnements complexes. Il atteint 76,6 % de réussite sur R2R-CE validation unseen, soit 9,7 points de plus que la meilleure approche à caméra unique et 4,5 points de plus que le meilleur système utilisant profondeur ou plusieurs caméras. Le modèle est entraîné entièrement en simulation sur environ 2,4 millions de trajectoires issues de 350k scènes, avec une méthode de prefix-caching qui réduit de 22× le nombre de tokens d'entraînement, puis un apprentissage par renforcement en ligne CISPO qui améliore le taux de réussite de 3,2 %. Il fonctionne sur robots à roues, à pattes et volants, et s'adapte à des obstacles réels non vus à l'entraînement.

    Motif de la recommandation :Un modèle de navigation incarnée de 8B qui atteint 76,6 % sur R2R-CE avec une seule caméra RGB, avec les détails d'entraînement et de RL.

  1. Google DeepMind76

    Google DeepMind lance Gemini Robotics-ER 1.6, axé sur le raisonnement incarné

    Google DeepMind lance Gemini Robotics-ER 1.6, une mise à niveau de son modèle de raisonnement pour la robotique qui renforce le raisonnement spatial et la compréhension multi-vues. Le modèle progresse sur le pointage, le comptage et la détection de succès par rapport à Gemini Robotics-ER 1.5 et Gemini 3.0 Flash, et ajoute la lecture d'instruments comme les manomètres et voyants de niveau, développée avec Boston Dynamics. Il est disponible dès aujourd'hui via la Gemini API et Google AI Studio, avec un Colab de démonstration.

    Motif de la recommandation :Présentation des capacités de raisonnement incarné et de la lecture d'instruments, avec comparaison des performances et accès développeur via API.

  1. Hugging Face Blog71

    NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique

    NVIDIA a publié Cosmos Reason 2, un modèle de vision-langage de raisonnement ouvert destiné à l'IA physique。

    Motif de la recommandation :NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique, avec des tailles 2B et 8B et un contexte de 256K.

Fin de la liste