Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
OpenAI présente MentalHealthBench, un benchmark élaboré avec des experts pour évaluer le caractère utile et sûr des réponses d'IA dans des conversations réalistes de santé mentale. Le benchmark couvre des échanges concrets de ce domaine.
Une nouvelle étude d'OpenAI Economic Research montre comment les travailleurs utilisent l'IA au-delà de leurs rôles traditionnels et quelles nouvelles activités deviennent des parties récurrentes de leur travail.
OpenAI partage de nouveaux résultats sur des problèmes ouverts de longue date en mathématiques et en informatique théorique, avec des avancées en géométrie, en cryptographie et en complexité.
OpenAI présente GPT-Red, un système de red teaming automatisé qui utilise le self-play pour améliorer la sécurité, l'alignement et la robustesse face aux injections de prompt.
Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.
OpenAI publie sa recherche B2B Signals montrant que les entreprises de pointe approfondissent leur adoption de l'IA et passent à l'échelle des workflows agentiques propulsés par Codex. Ces organisations construisent ainsi un avantage concurrentiel durable face aux autres entreprises.
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
OpenAI présente CoT-Control et constate que les modèles de raisonnement contrôlent difficilement leur chaîne de pensée, ce qui renforce la surveillabilité comme garde-fou de sécurité de l'IA.
Un nouveau preprint étend les amplitudes single-minus aux gravitons, GPT-5.2 Pro ayant contribué à dériver et vérifier des amplitudes d'arbre de gravitons non nulles en gravité quantique.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.
Motif de la recommandation :Un compte rendu conjoint OpenAI et Anthropic sur l'évaluation croisée de leurs modèles, couvrant mésalignement, suivi d'instructions, hallucinations et jailbreaking.
OpenAI publie BrowseComp, un benchmark destiné à évaluer les agents de navigation. Le contenu détaillé du benchmark, ses métriques et ses résultats ne sont pas précisés dans le texte source.
OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure si ces agents peuvent répliquer des travaux de recherche publiés, sans précision sur les modèles testés ni les scores obtenus.
Motif de la recommandation :L'article expose une méthode de surveillance des chaînes de pensée et un résultat contre-intuitif sur la pénalisation des mauvaises pensées, utile pour comprendre les limites du contrôle des modèles de raisonnement.
OpenAI publie SWE-bench Verified, un sous-ensemble de SWE-bench validé par des humains, destiné à évaluer plus fiablement la capacité des modèles d'IA à résoudre des problèmes logiciels réels.
Motif de la recommandation :OpenAI publie un sous-ensemble validé par des humains de SWE-bench, ce qui permet de situer la fiabilité de l'évaluation des capacités de codage des modèles.
OpenAI présente les Prover-Verifier Games, une méthode qui améliore la lisibilité des sorties des modèles de langage en les rendant plus claires et plus faciles à vérifier pour les humains comme pour les machines. Cette approche vise à renforcer la confiance dans les solutions d'IA en s'appuyant sur un jeu entre un prouveur et un vérificateur.
OpenAI présente une approche holistique pour construire un système de classification en langage naturel robuste et utile destiné à la modération de contenus dans le monde réel. Cette méthode vise à détecter les contenus indésirables en conditions réelles.
OpenAI développe un cadre d'évaluation du risque qu'un grand modèle de langage (LLM) aide une personne à créer une menace biologique. Dans une évaluation menée avec des experts en biologie et des étudiants, GPT-4 n'apporte au plus qu'une légère amélioration de la précision en matière de création de menaces biologiques. OpenAI précise que cette amélioration n'est pas assez importante pour être concluante, mais que ce résultat constitue un point de départ pour poursuivre la recherche et la réflexion communautaire.
Motif de la recommandation :OpenAI expose un cadre d'évaluation du risque biologique lié aux LLM et publie les résultats préliminaires sur GPT-4, utiles pour situer les travaux de sécurité.