Aller au contenu

Orientations techniques

Sécurité et alignement Dernières actualités

AI Sécurité et alignement de l'IA : jailbreak et défenses, recherche sur le comportement des modèles, évaluations de sécurité et cadres de gouvernance.

108 sélections30 derniers jours 8 entréesTotal : 358 entrées

mise à jour

Archives de la sélection · page 3

3mois25jourmercredi41–60 entrées
3mois12jourjeudi
  1. Google Research78

    Google Research publie une étude clinique sur l'IA de diagnostic conversationnel AMIE

    Google Research publie les résultats d'une étude de faisabilité prospective menée avec le Beth Israel Deaconess Medical Center。

    Motif de la recommandation :L'étude détaille le déploiement réel d'AMIE en soins primaires, avec des chiffres de sécurité et de précision diagnostique qui éclairent les limites d'un agent conversationnel médical.

3mois10jourmardi
3mois9jourlundi
  1. OpenAI News62

    OpenAI annonce l'acquisition de Promptfoo

    OpenAI annonce l'acquisition de Promptfoo, une plateforme de sécurité IA qui aide les entreprises à identifier et corriger les vulnérabilités de leurs systèmes d'IA pendant le développement.

    Motif de la recommandation :Une acquisition d'OpenAI dans la sécurité des systèmes d'IA, qui éclaire le positionnement des plateformes de test de vulnérabilités.

3mois6jourvendredi
2mois28joursamedi
  1. OpenAI News62

    OpenAI annonce un accord avec le ministère de la Guerre

    OpenAI a conclu un contrat avec le ministère de la Guerre, dont les détails portent sur les lignes rouges de sécurité。

    Motif de la recommandation :L'accord entre OpenAI et le ministère de la Guerre précise les lignes rouges de sécurité et les protections juridiques encadrant le déploiement de l'IA en environnement classifié.

2mois13jourvendredi
2mois4jourmercredi
  1. Google Research62

    Google Research et Included Health lancent une étude randomisée nationale sur l'IA en soins virtuels

    Google Research annonce, en partenariat avec Included Health, le lancement d'une étude randomisée nationale prospective avec consentement。

    Motif de la recommandation :L'original expose le passage de la simulation à un essai randomisé national en soins virtuels réels, avec les étapes de recherche qui le précèdent.

2mois1jourdimanche
12mois23jourmardi
  1. Hugging Face Blog62

    ServiceNow-AI publie AprielGuard, un modèle de garde-fou de 8B paramètres pour la sécurité des systèmes LLM

    ServiceNow-AI publie AprielGuard, un modèle de garde-fou de 8B paramètres conçu pour détecter 16 catégories de risques de sécurité ainsi que diverses attaques adversariales。

    Motif de la recommandation :Un modèle de garde-fou de 8B paramètres couvrant 16 catégories de risques et les attaques adversariales des workflows agentiques, avec les résultats d'évaluation détaillés.

12mois22jourlundi
  1. OpenAI News60

    OpenAI renforce ChatGPT Atlas contre l'injection de prompt

    OpenAI renforce ChatGPT Atlas contre les attaques d'injection de prompt en s'appuyant sur un red teaming automatisé entraîné par apprentissage par renforcement. Cette boucle proactive de découverte et de correction vise à identifier en amont de nouveaux exploits et à durcir les défenses de l'agent navigateur à mesure que l'IA devient plus agentique.

    Motif de la recommandation :L'original expose la boucle automatique de red teaming et de correction d'Atlas, ce qui permet de comprendre comment les défenses d'un agent navigateur sont renforcées.

12mois16jourmardi
  1. Google DeepMind62

    Google DeepMind publie Gemma Scope 2, une suite d'outils d'interprétabilité pour toute la famille Gemma 3

    Google DeepMind annonce Gemma Scope 2, une suite ouverte d'outils d'interprétabilité couvrant toutes les tailles de la famille Gemma 3。

    Motif de la recommandation :L'original expose la couverture complète de Gemma Scope 2 sur la famille Gemma 3 et les techniques d'entraînement employées, ce qui permet de situer les outils d'interprétabilité disponibles pour l'audit des modèles.

12mois11jourjeudi
12mois10jourmercredi
  1. Google DeepMind62

    Google DeepMind renforce son partenariat avec le gouvernement britannique pour l'IA dans la science et l'éducation

    Google DeepMind annonce un partenariat renforcé avec le gouvernement britannique pour accélérer l'usage de l'IA dans la science。

    Motif de la recommandation :Le partenariat détaille des accès prioritaires à des modèles scientifiques et un laboratoire automatisé, ce qui éclaire la trajectoire de l'IA appliquée à la recherche publique.

11mois20jourjeudi
11mois19jourmercredi
  1. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡, 说明该模型实施的安全措施. 系统卡涵盖模型层面的缓解手段, 包括针对有害任务和提示注入的专项安全训练, 以及产品层面的缓解手段, 如 agent 沙箱和可配置的网络访问.

    Motif de la recommandation :公开 GPT-5.1-Codex-Max 的安全措施细节, 包括针对有害任务与提示注入的专项训练及沙箱, 网络访问配置等产品级缓解手段.

11mois12jourmercredi
10mois30jourjeudi