ConvApparel : mesurer et combler l'écart de réalisme des simulateurs d'utilisateurs
Google Research présente ConvApparel, un jeu de données de plus de 4 000 conversations humain-IA multi-tours (près de 15 000 tours) dans le domaine de l'habillement。
Google Research présente ConvApparel, un jeu de données de plus de 4 000 conversations humain-IA multi-tours (près de 15 000 tours) dans le domaine de l'habillement。
Google Research dévoile PaperVizAgent, un agent de visualisation qui génère des figures académiques prêtes à publier。
Google Research propose un cadre d'évaluation des dispositions comportementales des LLM。
Le Falcon Vision Team du Technology Innovation Institute (TII) d'Abu Dhabi publie Falcon Perception。
Motif de la recommandation :Falcon Perception et Falcon OCR adoptent une architecture Transformer à fusion précoce unique, avec des benchmarks détaillés et un code open source pour comparer les compromis de conception.
Google Research montre, via un simulateur open source testé sur des jeux de données subjectifs (Toxicity。
OpenMed a entraîné CodonRoBERTa-large-v2, un modèle de langage au niveau des codons de 312M de paramètres。
Google Quantum AI a publié un livre blanc montrant que de futurs ordinateurs quantiques pourraient casser la cryptographie à courbes elliptiques protégeant les cryptomonnaies avec moins de qubits et de portes que estimé auparavant. Les circuits compilés pour l'algorithme de Shor sur ECDLP-256 utilisent moins de 1 200 qubits logiques et 90 millions de portes Toffoli, ou moins de 1 450 qubits logiques et 70 millions de portes Toffoli, exécutables en quelques minutes sur un CRQC supraconducteur de moins de 500 000 qubits physiques, soit une réduction d'environ 20 fois du nombre de qubits physiques nécessaires. Google recommande la transition des blockchains vers la cryptographie post-quantique (PQC) et a développé une preuve à divulgation nulle de connaissance pour permettre la vérification des vulnérabilités sans fournir de feuille de route aux acteurs malveillants, en collaboration avec le gouvernement américain et selon une échéance 2029.
Motif de la recommandation :Google Quantum AI détaille les ressources quantiques nécessaires pour casser ECDLP-256 et propose une divulgation par preuve à divulgation nulle de connaissance.
Google DeepMind publie de nouveaux résultats sur le risque que l'IA soit détournée à des fins de manipulation nuisible。
Motif de la recommandation :L'étude fournit un outil de mesure validé empiriquement et ouvre ses supports, ce qui permet de reproduire et d'étendre l'évaluation de la manipulation nuisible.
Google annonce Vibe Coding XR, un flux de travail qui associe Gemini au framework web XR Blocks pour transformer des descriptions en langage naturel en applications Android XR fonctionnelles et sensibles à la physique en moins de 60 secondes. Le système s'appuie sur des prompts système spécialisés et des modèles de code pour gérer la logique spatiale, avec des exemples allant d'un tuteur de mathématiques à une expérience de chimie immersive. Une évaluation préliminaire sur le jeu de données VCXR60, issu de quatre ateliers internes et comptant 60 prompts fournis par 20 participants, indique un taux de réussite d'environ 70 % lors des premières itérations, avant 11 versions majeures et la publication de XR Blocks Gem v0.11.0 comme référence de base. Le framework open source est accessible sur Android XR et une démonstration est prévue au stand Google à ACM CHI 2026.
Motif de la recommandation :Google détaille un flux de prototypage XR piloté par Gemini, avec des exemples concrets et une évaluation préliminaire sur 60 prompts.
Google Research 发布 TurboQuant 压缩算法, 并配套提出 QJL 与 PolarQuant, 三者将收录于 ICLR 2026 和 AISTATS 2026. TurboQuant 无需训练或微调即可把 KV cache 量化到 3 bit。
Motif de la recommandation :Google Research 公开 TurboQuant 等三种向量量化算法, 可在不损失精度的前提下把 KV cache 压到 3 bit, 并给出长上下文基准与向量检索的实测数据.
Google Research a introduit S2Vec, un cadre auto-supervisé qui apprend des embeddings généralistes du cadre bâti en rasterisant les données géospatiales via la bibliothèque S2 Geometry et un auto-encodage masqué (MAE). Lors des évaluations, S2Vec a montré des performances compétitives face aux approches basées sur l'image pour les tâches de prédiction socioéconomique, notamment en adaptation géographique (extrapolation), tout en révélant un besoin d'amélioration sur les tâches environnementales comme la couverture arborée et l'élévation. La fusion multimodale de S2Vec avec des embeddings d'images surpasse généralement l'usage d'une seule modalité.
ServiceNow 在 Hugging Face 发布端到端语音 Agent 评估框架 EVA, 同时给出 EVA-A (准确率)和 EVA-X (体验)两个总分。
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
Google Research a présenté à The Check Up ses avancées en IA pour la santé, dont un système de recherche multi-agents AMIE capable d'interpréter antécédents médicaux。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项研究, 评估 AI 乳腺筛查系统. 第一项研究对 125。
Motif de la recommandation :通过 NHS 多中心前瞻部署与阅片者研究, 给出 AI 乳腺筛查在真实工作流中的灵敏度, 时间与工作量数据.
Hugging Face a publié son analyse de l'écosystème open source au printemps 2026。
Motif de la recommandation :L'analyse quantifie la croissance de l'écosystème open source et le basculement de la Chine, offrant un contexte chiffré sur la répartition des usages.
Google DeepMind publie le papier « Measuring Progress Toward AGI: A Cognitive Taxonomy »。
Google Research a évalué six LLM — GPT-4o, Perplexity, Claude 3.5, Gemini Advanced Pro 1.5。
Berkeley AI Research présente SPEX et ProxySPEX, des algorithmes d'attribution capables d'identifier les interactions influentes dans les LLM à une échelle bien supérieure aux méthodes antérieures. SPEX exploite la parcimonie et le faible degré des interactions pour reformuler la recherche exhaustive en un problème de recouvrement parcimonieux résolu via des outils de traitement du signal et de théorie du codage. ProxySPEX tire parti de la propriété de hiérarchie des modèles et atteint les performances de SPEX avec environ 10x moins d'ablations. Sur une tâche d'analyse de sentiment, SPEX conserve une fidélité élevée lorsque le contexte atteint des milliers de features, là où LIME et Banzhaf affichent une fidélité nettement inférieure.
Google Research présente Groundsource, une méthodologie qui utilise Gemini pour transformer des articles de presse non structurés en données historiques exploitables. Le premier jeu de données open access porte sur les crues soudaines urbaines et contient 2,6 millions d'événements couvrant plus de 150 pays depuis 2000. Lors de vérifications manuelles, 60 % des événements extraits étaient exacts en lieu et date, et 82 % suffisamment précis pour une analyse pratique. Groundsource a capturé entre 85 % et 100 % des événements de crue sévère enregistrés par GDACS entre 2020 et 2026. Ces données permettent des prévisions de crues soudaines urbaines jusqu'à 24 heures à l'avance, désormais déployées dans Google Flood Hub.
Motif de la recommandation :L'article détaille une méthode d'extraction de données historiques à partir d'articles de presse avec Gemini et fournit des chiffres de validation concrets.
Google Research publie les résultats d'une étude de faisabilité prospective menée avec le Beth Israel Deaconess Medical Center。
Motif de la recommandation :L'étude détaille le déploiement réel d'AMIE en soins primaires, avec des chiffres de sécurité et de précision diagnostique qui éclairent les limites d'un agent conversationnel médical.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.
Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.
Hugging Face a étudié 16 bibliothèques RL open source construites autour de l'entraînement asynchrone et les a comparées selon 7 axes 。
Dix ans après qu'AlphaGo est devenu le premier programme à battre un champion du monde au Go。
Ulysses Sequence Parallelism, issu du protocole Arctic Long Sequence Training (ALST) de Snowflake AI Research。
Google Research présente WAXAL, un corpus vocal ouvert couvrant 27 langues d'Afrique subsaharienne parlées par plus de 100 millions de locuteurs dans plus de 26 pays. La publication inclut environ 1 846 heures d'audio transcrit pour la reconnaissance automatique de la parole (ASR) et plus de 565 heures d'enregistrements haute fidélité pour la synthèse vocale (TTS), sous licence CC-BY-4.0. Le projet, mené depuis 2021 avec des universités et organisations communautaires africaines, vise à soutenir la recherche et le développement de technologies vocales inclusives.
Motif de la recommandation :L'article détaille la composition et les licences d'un corpus vocal multilingue, utile pour évaluer la couverture des langues à faibles ressources.
OpenAI présente CoT-Control et constate que les modèles de raisonnement contrôlent difficilement leur chaîne de pensée, ce qui renforce la surveillabilité comme garde-fou de sécurité de l'IA.
Google Research montre que le fine-tuning supervisé sur les prédictions d'un assistant bayésien optimal permet aux LLM d'approcher un raisonnement probabiliste。
Un nouveau preprint étend les amplitudes single-minus aux gravitons, GPT-5.2 Pro ayant contribué à dériver et vérifier des amplitudes d'arbre de gravitons non nulles en gravité quantique.
Photoroom publie le troisième volet de sa série PRX, consacré à un speedrun d'entraînement d'un modèle text-to-image en 24 heures sur 32 H200。
Motif de la recommandation :L'article détaille la recette complète d'un entraînement text-to-image en 24h sur 32 H200 pour environ 1500 dollars, avec code open source.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
Hugging Face détaille dans un article de blog les évolutions de la bibliothèque transformers pour prendre en charge les modèles Mixture of Experts (MoE)。
Motif de la recommandation :L'article détaille les modifications d'ingénierie de transformers pour les MoE, avec des benchmarks de chargement et des API concrètes pour le déploiement.
OpenAI publie les tentatives de preuve de son modèle d'IA pour le défi mathématique First Proof。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
Google Research présente MapTrace, une nouvelle tâche。
Motif de la recommandation :L'article détaille un pipeline de génération de données synthétiques pour l'apprentissage du tracé d'itinéraires sur cartes, avec des résultats chiffrés sur MapBench.
OpenAI 发布预印本, 展示 GPT-5.2 为胶子振幅提出一个新公式, 随后由 OpenAI 与学术合作者正式证明并验证.
OpenAI publie GABRIEL, une nouvelle boîte à outils open source qui s'appuie sur GPT pour transformer des textes et des images qualitatifs en données quantitatives. Elle vise à aider les chercheurs en sciences sociales à analyser leurs corpus à grande échelle.
Google DeepMind annonce une mise à niveau majeure de Gemini 3 Deep Think, son mode de raisonnement spécialisé。
Motif de la recommandation :L'original expose les scores de Deep Think sur HLE, ARC-AGI-2 et Codeforces, ainsi que son ouverture via l'API Gemini, ce qui permet de situer le mode de raisonnement spécialisé de Gemini 3.
Hugging Face et Meta présentent OpenEnv, un framework open source qui évalue les agents IA contre de vrais systèmes plutôt que des simulations。
Motif de la recommandation :L'article détaille le framework OpenEnv et le benchmark Calendar Gym, avec des chiffres concrets sur les limites des agents et des cas d'erreur d'appel d'outils réutilisables.