Motif de la recommandation :L'article détaille un pipeline de génération de données synthétiques pour l'apprentissage du tracé d'itinéraires sur cartes, avec des résultats chiffrés sur MapBench.
Motif de la recommandation :Deux modèles de transcription vocale sont publiés, dont un en open weights sous Apache 2.0, avec des chiffres de latence et de prix permettant de comparer les options existantes.
Google DeepMind ouvre l'accès à Project Genie, un prototype de recherche expérimental réservé aux abonnés Google AI Ultra aux États-Unis (18 ans et plus).
Motif de la recommandation :Le prototype détaille trois capacités concrètes et les limites connues du modèle Genie 3, utile pour situer l'état réel des world models.
Motif de la recommandation :L'article présente l'architecture unifiée de D4RT et son efficacité jusqu'à 300 fois supérieure, utile pour évaluer les pistes de déploiement en robotique et en RA.
Motif de la recommandation :L'original détaille les nouvelles capacités d'imagerie médicale 3D et les benchmarks de MedGemma 1.5 4B, ainsi que le modèle vocal MedASR, ce qui permet de situer les progrès sur l'imagerie médicale de haute dimension.
Motif de la recommandation :NVIDIA publie Cosmos Reason 2, un VLM de raisonnement ouvert pour l'IA physique, avec des tailles 2B et 8B et un contexte de 256K.
Motif de la recommandation :Présente l'architecture hybride Mamba-Transformer et les fenêtres de contexte de 128K à 256K, utile pour évaluer les compromis entre taille et déploiement.
Motif de la recommandation :Un guide pas à pas pour assembler un assistant de bureau avec DGX Spark et Reachy Mini, utile à ceux qui veulent reproduire un agent multimodal local.
Motif de la recommandation :Mistral OCR 3 détaille ses performances sur formulaires, écriture manuscrite et tableaux complexes, avec un prix de 2 dollars pour 1 000 pages et une compatibilité descendante.
Motif de la recommandation :L'original expose les scores de Gemini 3 Flash sur GPQA Diamond, SWE-bench Verified et MMMU Pro ainsi que son prix, ce qui permet de situer le compromis vitesse-coût par rapport à Gemini 3 Pro.
Motif de la recommandation :L'original expose les améliorations de l'appel de fonctions, du suivi d'instructions et du dialogue multi-tours, ainsi que les points d'accès ouverts, ce qui permet de juger de l'impact sur les agents vocaux.
Motif de la recommandation :Le lecteur peut situer les quatre axes d'évaluation de la factualité et les écarts de performance entre les principaux modèles.
Motif de la recommandation :Mistral 3 publie les poids et les formats compressés, ce qui permet de comparer les tailles, les licences et les chemins de déploiement.
Motif de la recommandation :L'original détaille le fonctionnement de la vérification SynthID dans Gemini et l'extension à venir aux formats vidéo et audio.
Motif de la recommandation :L'original détaille les capacités de génération et d'édition d'images, les résolutions et les intégrations, ce qui aide le lecteur à évaluer les scénarios de production concernés.
Motif de la recommandation :Présentation des capacités de Nano Banana Pro et de sa disponibilité dans les produits Google, utile pour situer les usages de génération et d'édition d'images.
Motif de la recommandation :L'original détaille les scores de Gemini 3 Pro sur Terminal-Bench 2.0 et WebDev Arena ainsi que les tarifs API, ce qui permet de situer ses capacités de codage agentique.
Google Research présente la Generative UI, une capacité où le modèle génère non seulement du contenu mais toute une expérience utilisateur interactive.
Motif de la recommandation :L'article détaille l'implémentation de la génération d'interfaces par Gemini 3 Pro et son déploiement dans Gemini et Google Search, permettant de juger de l'impact sur les expériences utilisateur.
Google DeepMind présente SIMA 2, un agent généraliste qui intègre un modèle Gemini comme cœur de raisonnement et passe du suivi d'instructions à un compagnon de jeu interactif capable de converser et de s'auto-améliorer. Le système a été entraîné sur un mélange de vidéos de démonstration humaines et de labels générés par Gemini, et il généralise à des jeux non vus comme ASKA ou MineDojo, y compris dans des mondes générés en temps réel par Genie 3. SIMA 2 est publié en aperçu de recherche limité, avec un accès anticipé pour un petit groupe de chercheurs et de développeurs de jeux.
Motif de la recommandation :SIMA 2 intègre Gemini comme moteur de raisonnement et passe du suivi d'instructions à l'auto-amélioration dans des mondes 3D, avec des limites de mémoire et de tâches longues explicitement documentées.
Google DeepMind publie dans Nature un article montrant que réorganiser les représentations visuelles d'un modèle selon les hiérarchies conceptuelles humaines améliore sa robustesse et sa généralisation. L'équipe part d'un modèle pré-entraîné SigLIP-SO400M, entraîne un petit adaptateur sur le jeu de données THINGS, puis génère un nouveau jeu de données AligNet de plusieurs millions de jugements de type odd-one-out sur un million d'images pour affiner d'autres modèles. Les modèles alignés obtiennent de meilleurs résultats sur des tâches de sciences cognitives et sur des tâches d'apprentissage few-shot et de distribution shift.
Motif de la recommandation :L'article détaille une méthode en trois étapes pour aligner les représentations visuelles des modèles sur les hiérarchies conceptuelles humaines, avec des gains mesurés sur la robustesse et la généralisation.