Aller au contenu

Orientations techniques

Multimodal Dernières actualités

Les capacités au-delà du texte : compréhension visuelle, mixte texte-image, entrées et sorties audio et vidéo — avancées des modèles et des produits.

85 sélections30 derniers jours 6 entréesTotal : 124 entrées

mise à jour

Archives de la sélection · page 3

18 févriermer.41–60 entrées
  1. Google Research60

    Google Research présente MapTrace, un pipeline de données synthétiques pour apprendre aux MLLM à tracer des itinéraires sur des cartes

    Google Research présente MapTrace, une nouvelle tâche.

    Motif de la recommandation :L'article détaille un pipeline de génération de données synthétiques pour l'apprentissage du tracé d'itinéraires sur cartes, avec des résultats chiffrés sur MapBench.

5 févrierjeu.
30 janvierven.
  1. Google DeepMind78

    Google DeepMind déploie Project Genie, prototype de création de mondes interactifs

    Google DeepMind ouvre l'accès à Project Genie, un prototype de recherche expérimental réservé aux abonnés Google AI Ultra aux États-Unis (18 ans et plus).

    Motif de la recommandation :Le prototype détaille trois capacités concrètes et les limites connues du modèle Genie 3, utile pour situer l'état réel des world models.

16 janvierven.
14 janviermer.
6 janviermar.
5 janvierlun.
17 décembremer.
  1. Google DeepMind88

    Google DeepMind publie Gemini 3 Flash, un modèle rapide et moins coûteux

    Google DeepMind publie Gemini 3 Flash, un modèle de la famille Gemini 3 conçu pour la vitesse et proposé à un coût réduit. Il atteint 90.

    Motif de la recommandation :L'original expose les scores de Gemini 3 Flash sur GPQA Diamond, SWE-bench Verified et MMMU Pro ainsi que son prix, ce qui permet de situer le compromis vitesse-coût par rapport à Gemini 3 Pro.

13 décembresam.
9 décembremar.
  1. Google DeepMind62

    Google DeepMind et Kaggle lancent la suite de benchmarks FACTS pour évaluer la factualité des LLM

    Google DeepMind et Kaggle lancent la suite de benchmarks FACTS, qui étend le FACTS Grounding Benchmark avec trois nouveaux benchmarks.

    Motif de la recommandation :Le lecteur peut situer les quatre axes d'évaluation de la factualité et les écarts de performance entre les principaux modèles.

3 décembremer.
20 novembrejeu.
  1. Google DeepMind80

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image)

    Google DeepMind publie Nano Banana Pro (Gemini 3 Pro Image), un modèle de génération et d'édition d'images construit sur Gemini 3 Pro.

    Motif de la recommandation :L'original détaille les capacités de génération et d'édition d'images, les résolutions et les intégrations, ce qui aide le lecteur à évaluer les scénarios de production concernés.

19 novembremer.
  1. Google Research80

    Google déploie la Generative UI dans Gemini et la recherche avec Gemini 3 Pro

    Google Research présente la Generative UI, une capacité où le modèle génère non seulement du contenu mais toute une expérience utilisateur interactive.

    Motif de la recommandation :L'article détaille l'implémentation de la génération d'interfaces par Gemini 3 Pro et son déploiement dans Gemini et Google Search, permettant de juger de l'impact sur les expériences utilisateur.

13 novembrejeu.
  1. Google DeepMind74

    Google DeepMind présente SIMA 2, un agent qui joue, raisonne et apprend dans des mondes 3D virtuels

    Google DeepMind présente SIMA 2, un agent généraliste qui intègre un modèle Gemini comme cœur de raisonnement et passe du suivi d'instructions à un compagnon de jeu interactif capable de converser et de s'auto-améliorer. Le système a été entraîné sur un mélange de vidéos de démonstration humaines et de labels générés par Gemini, et il généralise à des jeux non vus comme ASKA ou MineDojo, y compris dans des mondes générés en temps réel par Genie 3. SIMA 2 est publié en aperçu de recherche limité, avec un accès anticipé pour un petit groupe de chercheurs et de développeurs de jeux.

    Motif de la recommandation :SIMA 2 intègre Gemini comme moteur de raisonnement et passe du suivi d'instructions à l'auto-amélioration dans des mondes 3D, avec des limites de mémoire et de tâches longues explicitement documentées.

11 novembremar.
  1. Google DeepMind60

    Google DeepMind publie dans Nature une méthode pour aligner la vision des IA sur celle des humains

    Google DeepMind publie dans Nature un article montrant que réorganiser les représentations visuelles d'un modèle selon les hiérarchies conceptuelles humaines améliore sa robustesse et sa généralisation. L'équipe part d'un modèle pré-entraîné SigLIP-SO400M, entraîne un petit adaptateur sur le jeu de données THINGS, puis génère un nouveau jeu de données AligNet de plusieurs millions de jugements de type odd-one-out sur un million d'images pour affiner d'autres modèles. Les modèles alignés obtiennent de meilleurs résultats sur des tâches de sciences cognitives et sur des tâches d'apprentissage few-shot et de distribution shift.

    Motif de la recommandation :L'article détaille une méthode en trois étapes pour aligner les représentations visuelles des modèles sur les hiérarchies conceptuelles humaines, avec des gains mesurés sur la robustesse et la généralisation.