De l'assistance à l'exécution : comment les entreprises mettent l'IA au travail
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
Microsoft Research présente CARE-X, un modèle de vision-langage unifié pour l'interprétation clinique des radiographies thoraciques。
Multiverse Computing 发布论文« Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss »。
Motif de la recommandation :提出离线 top-K logits 缓存与融合分块 KL 损失两项系统改动, 把长上下文蒸馏显存从数百 GB 降到单卡可跑.
OpenAI partage de nouveaux résultats sur des problèmes ouverts de longue date en mathématiques et en informatique théorique, avec des avancées en géométrie, en cryptographie et en complexité.
OpenAI的新研究显示, ChatGPT用户正在跨角色承担任务, 人工智能正在拓展工作者的工作范围并重塑岗位边界. 该研究基于ChatGPT用户的实际使用情况, 揭示了AI对职场分工的影响.
Berkeley AI Research présente ABBEL, un framework qui isole et supervise le contenu des résumés sous forme d'états de croyance en langage naturel.
Google DeepMind annonce un engagement de 40 millions de dollars en tokens d'IA et crédits cloud pour les chercheurs soutenant la Genesis Mission。
DharmaOCR, modèle OCR spécialisé pour le portugais brésilien, obtient 0,925 sur son benchmark dédié。
ChatGPT Work prend en charge des workflows de data science, notamment les briefs de root cause。
Aditya G. Parameswaran (UC Berkeley) et ses collaborateurs identifient trois défis pour les data systems à l'ère de l'inférence quasi gratuite.
PRX détaille dans son Part 4 la stratégie de données derrière son modèle de 7B 。
Google Research publie un jeu de données ouvert d'albédo des toitures à l'échelle du bâtiment couvrant plus de 50 villes dans 9 pays。
Google Research présente TabFM, un modèle de fondation pour la classification et la régression sur données tabulaires qui élimine l'entraînement manuel。
Motif de la recommandation :L'article détaille l'architecture hybride et l'entraînement sur données synthétiques de TabFM, ce qui permet de comprendre comment le zero-shot s'applique aux données tabulaires.
OpenAI présente GeneBench-Pro, un nouveau benchmark évaluant les performances de l'IA en génomique。
OpenAI publie un rapport qui cartographie la manière dont l'IA pourrait transformer les emplois dans l'UE。
Google Research montre, dans un article présenté à COLM 2026, que le raisonnement débloque la connaissance paramétrique des LLM 。
Hugging Face博客发布MosaicLeaks, 一个针对深度研究Agent的隐私泄露基准, 包含1001条多跳研究链, 交错本地企业文档与受控网页语料。
Motif de la recommandation :提出多跳研究链上的隐私泄露基准与PA-DR训练方法, 给出可复现的泄露度量与训练效率对比.
Des chercheurs ont utilisé un modèle de raisonnement d'OpenAI pour aider au diagnostic de maladies rares, identifiant 18 nouveaux diagnostics dans des cas auparavant non résolus.
Hugging Face publie une analyse comparative des techniques de fine-tuning paramétrique efficace (PEFT) et conclut que LoRA。
Motif de la recommandation :Les benchmarks comparatifs de la bibliothèque PEFT montrent que LoRA n'est pas toujours le meilleur compromis, avec des chiffres et des configurations transférables.
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
Google Research publie un jeu de données vectorisées qui transforme les cartes haute résolution des haies。
OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.
Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.
Google Research présente Regularized f-Divergence Kernel Tests, un cadre d'audit du machine unlearning dévoilé à AISTATS 2026。
Google DeepMind publie les résultats d'un essai contrôlé randomisé pré-enregistré mené en Sierra Leone sur Guided Learning。
Motif de la recommandation :L'essai contrôlé randomisé pré-enregistré en Sierra Leone fournit des chiffres d'effet et des données d'interaction, utiles pour évaluer l'usage pédagogique de l'IA.
Google Research présente PHRM, un système de recherche qui utilise la caméra frontale du smartphone pour capturer des vidéos du visage après le déverrouillage et estime la fréquence cardiaque par photopléthysmographie à distance et apprentissage profond, avec une MAPE inférieure à 10 % par rapport à l'électrocardiogramme. Le système agrège les mesures de la journée pour estimer la fréquence cardiaque au repos quotidienne, avec une MAE inférieure à 5 bpm par rapport aux objets portables. L'étude s'appuie sur plus de 350 000 clips vidéo de près de 700 participants, en veillant à la représentation des différents tons de peau, et publie le plus grand ensemble de données vidéo de smartphone disponible pour la recherche ainsi qu'un modèle pré-entraîné PHRM-mini.
Motif de la recommandation :Le système PHRM utilise la caméra frontale du téléphone pour surveiller en arrière-plan la fréquence cardiaque et la fréquence cardiaque au repos, avec une précision proche de celle des objets portables, et publie le plus grand ensemble de données diversifié à ce jour.
OpenAI annonce de nouvelles capacités pour GPT-Rosalind, destinées à la recherche en sciences de la vie. Le modèle renforce le raisonnement biologique。
Motif de la recommandation :L'annonce présente les capacités de GPT-Rosalind en raisonnement biologique et analyse génomique, utile pour situer les outils IA dédiés à la recherche en sciences de la vie.
Google Research présente une nouvelle méthode d'agrégation cryptographique pour l'analyse privée。
Selon une nouvelle étude d'OpenAI, 4 millions d'Américains utilisent ChatGPT pour lancer, gérer et développer des petites entreprises, l'IA réduisant le coût de l'entrepreneuriat.
Hugging Face publie OlmoEarth v1.1, une famille de modèles d'observation de la Terre qui réduit jusqu'à 3x les coûts de calcul tout en conservant les performances d'OlmoEarth v1. La réduction repose sur la fusion des tokens par résolution pour Sentinel-2, ce qui divise par trois le nombre de tokens, au prix d'une modification du pré-entraînement pour éviter une baisse de 10 points sur m-eurosat kNN. Les poids et le code d'entraînement des modèles Base, Tiny et Nano sont disponibles.
Google DeepMind présente l'utilisation de Co-Scientist par les biologistes Omar Abudayyeh et Jonathan Gootenberg pour accélérer la recherche sur le vieillissement cellulaire. L'outil a analysé des dizaines de milliers d'articles et proposé plus de 20 facteurs génétiques nouveaux et plausibles à tester ; des tests en laboratoire ont validé quelques hypothèses, les facteurs recommandés ayant conduit les cellules vers un état plus jeune avec une fonction globale améliorée. Co-Scientist réduit aussi le temps d'analyse des données de criblage, qui pouvait prendre jusqu'à six mois, à quelques jours seulement.
Motif de la recommandation :L'original montre comment Co-Scientist propose des cibles génétiques et réduit de six mois à quelques jours l'analyse de criblage, une méthode transférable à d'autres équipes.
Google DeepMind Co-Scientist a permis à l'équipe de Filippo Menolascina, bioingénieur à l'Université d'Edimbourg。
Google DeepMind présente une étude publiée dans Advanced Science où Co-Scientist a proposé trois médicaments candidats contre la fibrose hépatique。
Motif de la recommandation :Un cas concret montre comment un système d'IA propose des médicaments candidats et comment deux d'entre eux bloquent la fibrose sur cellules hépatiques humaines.
Parameter Golf a réuni plus de 1 000 participants et 2 000 soumissions pour explorer la recherche en machine learning assistée par IA。
AWS 发布系列文章, 解析基础模型训练与推理在 AWS 上的分层架构, 涵盖加速计算, 高带宽低延迟网络与分布式存储三大基础设施模块. 文章指出扩展规律已从单一预训练曲线演变为预训练。
IBM publie un descriptif technique détaillé de la construction des Granite 4.1, une famille de LLM denses decoder-only de 3B。
Motif de la recommandation :L'article détaille le pipeline de pré-entraînement en cinq phases et la recette RL de Granite 4.1, utile pour comprendre comment un dense 8B rivalise avec un MoE 32B.
OpenAI présente un cadre d'analyse couvrant 921 métiers et 148 millions d'emplois aux États-Unis pour identifier ceux exposés au risque d'automatisation。
Google DeepMind publie un article sur Decoupled DiLoCo, une architecture distribuée qui divise les entraînements LLM en îlots de calcul découplés avec flux de données asynchrone。
Motif de la recommandation :L'article détaille l'architecture Decoupled DiLoCo et ses résultats sur Gemma 4, permettant de comprendre comment l'entraînement distribué gagne en résilience et en efficacité.
OpenAI publie Privacy Filter, un modèle à poids ouverts destiné à détecter et masquer les informations personnelles identifiables (PII) dans du texte, avec une précision annoncée comme état de l'art.
Motif de la recommandation :Un modèle à poids ouverts d'OpenAI dédié à la détection et à la suppression des données personnelles, avec un point d'entrée concret pour les flux de traitement de texte.
Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.