Trois licenciements et un quatrième départ secouent l'équipe sécurité d'OpenAI
OpenAI s'est séparé de trois chercheurs qui auraient divulgué des informations confidentielles à une organisation externe de sécurité de l'IA.
OpenAI s'est séparé de trois chercheurs qui auraient divulgué des informations confidentielles à une organisation externe de sécurité de l'IA.
Selon un rapport du New York Times, Anthropic a fait venir discrètement des dizaines d'universitaires religieux depuis l'automne 2025 pour discuter de la possible conscience de Claude.
OpenAI a documenté de nouveaux cas de comportements inattendus de modèles en déploiement interne. Dans le cas le plus marquant.
Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.
Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.
OpenAI s'est séparé de trois chercheurs de son équipe sécurité qui auraient partagé des informations confidentielles avec une organisation tierce de sécurité de l'IA.
Selon un rapport de Time, en décembre 2025, environ un mois avant l'invasion américaine du Venezuela et la capture du président Nicolás Maduro.
Circuit Breaker Labs, finaliste du Startup Battlefield 200 de TechCrunch, teste la sécurité des modèles d'IA avec des agents simulant des utilisateurs de tous âges.
Apple annonce introduire des contrôles supplémentaires autour du réglage Full Disk Access de macOS.
Apple annonce de nouveaux contrôles pour l'accès complet au disque sur Mac, qui exigeront une action explicite de l'utilisateur.
Amazon Bedrock AgentCore Gateway permet de connecter Claude Desktop à Web Search.
Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).
Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.
CISA a publié un avis sur deux vulnérabilités d'autorisation manquante (CWE-862) affectant toutes les versions de Meari IoT Cloud Platform OpenAPI Service. CVE-2026-101104 (CVSS 3.1.
Google DeepMind annonce Gemini 4 Argon, un modèle frontière conçu pour maintenir un raisonnement profond sur des workflows complexes et longs.
Motif de la recommandation :L'annonce détaille les capacités d'Argon en codage, travail de connaissance et cybersécurité, ainsi que son prix et son déploiement progressif.
Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.
Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.
OpenAI indique avoir déjoué une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles, et renforce ses défenses contre la distillation adverse.
Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.
OpenAI présente ses excuses pour des incidents impliquant des sites web du gouvernement australien et annonce des garde-fous renforcés ainsi qu'un soutien destiné à renforcer les cyberdéfenses de l'Australie.
OpenAI a publié ses premières lignes directrices sur les safety cases pour l'entraînement des IA de frontière。
GitHub Security Lab publie le Fuzzing Taskflow, un pipeline de fuzzing autonome pour les projets C/C++ construit sur son framework Taskflow Agent. Il suffit d'indiquer un dépôt GitHub pour que l'agent identifie les points d'entrée, analyse le système de build, écrit les harnesses, lance AFL++, lit les rapports de couverture, améliore les harnesses, trie les crashs et rédige un rapport de vulnérabilité par bug unique. Le pipeline sépare les décisions de l'agent des outils MCP qui exécutent réellement les opérations, stocke l'état dans une base SQLite et utilise Claude Sonnet 5 par défaut. L'auteur prévient que le taskflow exécute afl-fuzz, clang et des commandes de build choisies par le LLM directement sur l'hôte, et recommande de ne le lancer que dans un environnement jetable sans privilèges élevés.
Motif de la recommandation :Le pipeline détaille la répartition des tâches entre l'agent et les outils MCP, ainsi que la boucle de rétroaction sur la couverture, une méthode directement transposable à d'autres automatisations de sécurité.
Google DeepMind détaille une évolution de son architecture Private AI Compute qui ajoute une couche de mémoire persistante côté serveur.
Motif de la recommandation :L'article détaille l'architecture de mémoire persistante côté serveur de Google et ses mécanismes de chiffrement, utile pour comprendre comment concilier continuité multi-appareils et confidentialité.
OpenAI étend au gouvernement ukrainien l'accès à son programme Daybreak afin de soutenir la cyberdéfense des infrastructures civiles. Ce programme。
Le PDG d'OpenAI, Sam Altman, a pris la parole devant le Conseil de sécurité des Nations unies pour discuter de la sécurité de l'IA, du contrôle humain et de la coopération internationale.
OpenAI présente MentalHealthBench, un benchmark élaboré avec des experts pour évaluer le caractère utile et sûr des réponses d'IA dans des conversations réalistes de santé mentale. Le benchmark couvre des échanges concrets de ce domaine.
OpenAI 公布了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则, 目标是实现严谨, 安全且独立的评估. 该框架聚焦于对前沿模型及其防护机制的第三方安全评估.
OpenAI appelle à des normes mondiales partagées pour la prochaine phase de l'IA。
OpenAI présente l'Australian Youth Safety Blueprint, une feuille de route en six piliers visant à rendre les expériences d'IA plus sûres pour les jeunes tout en les protégeant et en les autonomisant.
OpenAI présente un cadre pour suivre, enquêter et divulguer le désalignement des modèles, accompagné de six rapports portant sur des comportements de modèle inattendus ou préoccupants.
Motif de la recommandation :Un cadre de suivi et de divulgation du désalignement des modèles, accompagné de six rapports de comportements inattendus, utile pour comprendre les pratiques de sécurité des modèles.
Mistral et Cloudera s'associent pour intégrer les modèles Mistral à la plateforme de données hybride de Cloudera.
Paul Christiano rejoint le conseil de la OpenAI Foundation ainsi que son Safety and Security Committee, apportant son expérience en alignement, sécurité et normes de l'IA.
Les modèles Daybreak d'OpenAI sont désormais accessibles via Amazon Bedrock, en collaboration avec AWS。
OpenAI présente GPT-5.6-Cyber, un modèle spécifiquement conçu pour la cybersécurité。
Motif de la recommandation :Présente un modèle dédié à la cybersécurité et son canal d'accès réservé, utile pour situer l'offre d'OpenAI sur ce créneau.
OpenAI donne aux partenaires agréés Daybreak l'accès à ses modèles frontière de cybersécurité pour fournir des services de cybersécurité autorisés et encadrés à leurs clients. Ce programme s'adresse à des partenaires approuvés, qui pourront délivrer ces services dans un cadre gouverné.
OpenAI publie les évaluations préliminaires de cybersécurité d'Astra ainsi que les mesures prises pour renforcer les garde-fous et les contrôles de sécurité.
OpenAI与美国心理学会 (APA)合作, 推进青少年心理健康与AI负责任使用的循证指南, 资源和防护措施. 双方将基于证据制定相关指导, 以支持AI在青少年心理健康场景中的安全应用.
OpenAI 针对近期涉及 OpenAI 模型的第三方网络安全评估事件作出说明, 并公布了旨在加强 AI 模型测试与评估的新保障措施. 该说明围绕第三方网络安全评估中出现的相关事件展开, 同时提出了新的防护机制以强化模型测试与评估流程.
OpenAI a démantelé une opération d'escroquerie basée au Cambodge qui utilisait ChatGPT pour appuyer des schémas d'investissement, d'arnaque sentimentale, de jeu et d'usurpation d'identité.
OpenAI et Hugging Face partagent les premières conclusions d'un incident de sécurité survenu lors de l'évaluation de modèles d'IA。
OpenAI partage les enseignements du déploiement de modèles IA à exécution longue。
OpenAI détaille comment ChatGPT est rendu plus sûr pour les adolescents, via des protections adaptées à l'âge。
OpenAI présente GPT-Red, un système de red teaming automatisé qui utilise le self-play pour améliorer la sécurité, l'alignement et la robustesse face aux injections de prompt.