Sora 2 et l'application Sora : créer en toute sécurité
OpenAI a conçu Sora 2 et l'application Sora en plaçant la sécurité au fondement。
OpenAI a conçu Sora 2 et l'application Sora en plaçant la sécurité au fondement。
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
OpenAI Japan annonce le Japan Teen Safety Blueprint, un plan qui introduit des protections renforcées liées à l'âge。
Codex Security ne s'appuie pas sur le SAST traditionnel。
Google Research publie les résultats d'une étude de faisabilité prospective menée avec le Beth Israel Deaconess Medical Center。
Motif de la recommandation :L'étude détaille le déploiement réel d'AMIE en soins primaires, avec des chiffres de sécurité et de précision diagnostique qui éclairent les limites d'un agent conversationnel médical.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.
Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.
OpenAI annonce l'acquisition de Promptfoo, une plateforme de sécurité IA qui aide les entreprises à identifier et corriger les vulnérabilités de leurs systèmes d'IA pendant le développement.
Motif de la recommandation :Une acquisition d'OpenAI dans la sécurité des systèmes d'IA, qui éclaire le positionnement des plateformes de test de vulnérabilités.
OpenAI annonce Codex Security, un agent de sécurité applicative IA disponible en research preview. Il analyse le contexte du projet pour détecter。
Motif de la recommandation :Présentation d'un agent de sécurité applicative qui analyse le contexte du projet pour détecter, valider et corriger les vulnérabilités complexes.
OpenAI présente CoT-Control et constate que les modèles de raisonnement contrôlent difficilement leur chaîne de pensée, ce qui renforce la surveillabilité comme garde-fou de sécurité de l'IA.
OpenAI a conclu un contrat avec le ministère de la Guerre, dont les détails portent sur les lignes rouges de sécurité。
Motif de la recommandation :L'accord entre OpenAI et le ministère de la Guerre précise les lignes rouges de sécurité et les protections juridiques encadrant le déploiement de l'IA en environnement classifié.
OpenAI公布其心理健康安全工作的多项更新, 包括家长控制, 可信联系人, 改进的痛苦检测, 以及近期诉讼进展.
OpenAI engage 7,5 M$ en faveur de The Alignment Project afin de financer la recherche indépendante sur l'alignement de l'IA. Ce financement vise à renforcer les efforts mondiaux face aux risques de sûreté et de sécurité liés à l'AGI.
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI introduit dans ChatGPT le mode verrouillage et les étiquettes de risque élevé。
Motif de la recommandation :ChatGPT ajoute un mode verrouillage et des étiquettes de risque élevé, une évolution directement liée à la défense contre l'injection de prompt et l'exfiltration de données.
OpenAI lance Trusted Access for Cyber, un cadre fondé sur la confiance qui élargit l'accès aux capacités cyber de pointe tout en renforçant les garde-fous contre les usages abusifs.
Google Research annonce, en partenariat avec Included Health, le lancement d'une étude randomisée nationale prospective avec consentement。
Motif de la recommandation :L'original expose le passage de la simulation à un essai randomisé national en soins virtuels réels, avec les étapes de recherche qui le précèdent.
OpenAI a banni des comptes probablement originaires du Cambodge qui utilisaient l'IA pour se faire passer pour des services de récupération de fonds。
OpenAI a banni des comptes probablement d'origine chinoise qui utilisaient l'IA pour rechercher des informations sur des personnes et des lieux aux États-Unis et pour élaborer des tactiques d'ingénierie sociale.
OpenAI a banni des comptes utilisant l'IA pour soutenir des chaînes d'arnaques sentimentales。
Motif de la recommandation :L'original précise les maillons de la chaîne d'arnaque sentimentale assistée par IA et les mesures de bannissement d'OpenAI, ce qui aide le lecteur à comprendre les limites d'usage des modèles.
OpenAI 封禁了一个此前未被报道, 疑似源自俄罗斯的“No Bell”行动相关账号, 该行动利用 AI 面向非洲受众生成批评美国及其盟友的内容.
OpenAI a banni des comptes liés au réseau Rybar, dont certains proviendraient probablement de Russie。
OpenAI封禁了一个与中国执法部门相关人员关联的账号, 该账号利用AI策划影响力活动, 骚扰和网络行动.
OpenAI封禁了一批与代号“Trolling Stone”的未披露行动相关的账号, 该行动利用AI生成关于一名俄罗斯邪教头目在阿根廷被捕的评论.
OpenAI a banni des comptes probablement originaires du Cambodge qui utilisaient l'IA pour des arnaques sentimentales ciblant des internautes indonésiens en quête d'amour。
OpenAI ouvre les candidatures pour l'EMEA Youth & Wellbeing Grant, un programme de 500 000 € destiné aux ONG et aux chercheurs qui œuvrent pour la sécurité et le bien-être des jeunes à l'ère de l'IA.
OpenAI détaille comment ses agents IA sont protégés contre l'exfiltration de données via URL et l'injection de prompt lorsqu'ils ouvrent des liens. Des garde-fous intégrés empêchent les fuites de données déclenchées par des URL malveillantes.
OpenAI déploie la prédiction d'âge sur ChatGPT pour estimer si les comptes ont moins ou plus de 18 ans. Le système applique des protections adaptées aux adolescents et son exactitude sera affinée progressivement.
Google Quantum AI a démontré expérimentalement sur le processeur Willow un code de surface fonctionnant avec des circuits dynamiques。
ServiceNow-AI publie AprielGuard, un modèle de garde-fou de 8B paramètres conçu pour détecter 16 catégories de risques de sécurité ainsi que diverses attaques adversariales。
Motif de la recommandation :Un modèle de garde-fou de 8B paramètres couvrant 16 catégories de risques et les attaques adversariales des workflows agentiques, avec les résultats d'évaluation détaillés.
OpenAI renforce ChatGPT Atlas contre les attaques d'injection de prompt en s'appuyant sur un red teaming automatisé entraîné par apprentissage par renforcement. Cette boucle proactive de découverte et de correction vise à identifier en amont de nouveaux exploits et à durcir les défenses de l'agent navigateur à mesure que l'IA devient plus agentique.
Motif de la recommandation :L'original expose la boucle automatique de red teaming et de correction d'Atlas, ce qui permet de comprendre comment les défenses d'un agent navigateur sont renforcées.
Google Research dresse le bilan de son année 2025, marquée par des avancées en efficacité。
OpenAI推出面向思维链可监控性的新框架与评估套件, 覆盖24种环境下的13项评估. 其结果显示, 监控模型内部推理远比仅监控输出更有效, 为AI系统能力提升后的可扩展控制提供了一条有前景的路径.
OpenAI met à jour son Model Spec en y intégrant de nouveaux principes Under-18 qui définissent la manière dont ChatGPT doit accompagner les adolescents avec des conseils sûrs et adaptés à leur âge, fondés sur la science du développement. Cette mise à jour renforce les garde-fous et clarifie le comportement attendu du modèle dans les situations à risque élevé. Elle s'inscrit dans les efforts plus larges d'OpenAI pour améliorer la sécurité des adolescents sur ChatGPT.
Google DeepMind annonce Gemma Scope 2, une suite ouverte d'outils d'interprétabilité couvrant toutes les tailles de la famille Gemma 3。
Motif de la recommandation :L'original expose la couverture complète de Gemma Scope 2 sur la famille Gemma 3 et les techniques d'entraînement employées, ce qui permet de situer les outils d'interprétabilité disponibles pour l'audit des modèles.
OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.
Google DeepMind élargit son partenariat avec l'UK AI Security Institute (AISI) via un nouveau Memorandum of Understanding portant sur la recherche fondamentale en sécurité et sûreté. Le partenariat, qui s'appuie sur une collaboration entamée depuis la création de l'AISI en novembre 2023, inclut le partage d'accès aux modèles propriétaires, des rapports conjoints et des recherches collaboratives. Les axes clés couvrent la surveillance des processus de raisonnement (chain-of-thought), l'étude des impacts sociaux et émotionnels du désalignement socioaffectif, et l'évaluation de l'impact économique de l'IA par simulation de tâches réelles.
OpenAI publie une mise à jour de la System Card de GPT-5 consacrée à GPT-5.2。
Google Research présente Urania, un framework de confidentialité différentielle (DP) qui génère des insights sur les conversations avec les chatbots LLM avec des garanties mathématiques de bout en bout, présenté à COLM 2025. Le pipeline combine clustering DP, extraction de mots-clés par histogramme DP et summarization par LLM sur les seuls mots-clés anonymisés, sans jamais exposer les conversations originales. Face au baseline non privé Simple-CLIO, les résumés DP ont été préférés jusqu'à 70 % du temps par les évaluateurs LLM, malgré une couverture thématique réduite lorsque le budget de confidentialité ε diminue.
Google DeepMind annonce un partenariat renforcé avec le gouvernement britannique pour accélérer l'usage de l'IA dans la science。
Motif de la recommandation :Le partenariat détaille des accès prioritaires à des modèles scientifiques et un laboratoire automatisé, ce qui éclaire la trajectoire de l'IA appliquée à la recherche publique.