Aller au contenu

Orientations techniques

Sécurité et alignement Dernières actualités

AI Sécurité et alignement de l'IA : jailbreak et défenses, recherche sur le comportement des modèles, évaluations de sécurité et cadres de gouvernance.

108 sélections30 derniers jours 8 entréesTotal : 358 entrées

mise à jour

Archives de la sélection · page 4

10mois30jourjeudi61–80 entrées
10mois29jourmercredi
  1. OpenAI News68

    OpenAI lance gpt-oss-safeguard, un modèle de raisonnement à poids ouverts pour la classification de sécurité

    OpenAI présente gpt-oss-safeguard, un modèle de raisonnement à poids ouverts destiné à la classification de sécurité。

    Motif de la recommandation :Un modèle de raisonnement à poids ouverts dédié à la classification de sécurité, qui permet aux développeurs d'appliquer et d'itérer leurs propres politiques.

10mois27jourlundi
  1. OpenAI News60

    OpenAI améliore les réponses de ChatGPT dans les conversations sensibles

    OpenAI a collaboré avec plus de 170 experts en santé mentale pour améliorer la capacité de ChatGPT à reconnaître la détresse。

    Motif de la recommandation :L'original expose la collaboration avec plus de 170 experts en santé mentale et la baisse des réponses dangereuses, ce qui permet de juger de l'orientation de ChatGPT sur les sujets sensibles.

10mois1jourmercredi
9mois30jourmardi
9mois17jourmercredi
  1. OpenAI News62

    OpenAI et Apollo Research développent des évaluations pour détecter et réduire la dissimulation dans les modèles d'IA

    Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。

    Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.

9mois5jourvendredi
  1. OpenAI News60

    OpenAI explique pourquoi les modèles de langage hallucinent

    OpenAI publie une nouvelle recherche expliquant pourquoi les modèles de langage hallucinent. Les résultats montrent que l'amélioration des évaluations peut renforcer la fiabilité。

    Motif de la recommandation :L'article explique les causes des hallucinations des modèles de langage et propose des pistes d'évaluation pour améliorer la fiabilité et l'honnêteté.

8mois27jourmercredi
8mois7jourjeudi
  1. OpenAI News85

    OpenAI publie la fiche système de GPT-5

    OpenAI publie la fiche système de GPT-5, qui décrit un système de routage unifié de modèles assurant des réponses rapides et intelligentes via gpt-5-main。

    Motif de la recommandation :La fiche système détaille le routage unifié entre gpt-5-main, gpt-5-thinking et gpt-5-thinking-nano, un point d'architecture utile pour comprendre le comportement du modèle.

7mois17jourjeudi
6mois1jourdimanche
3mois25jourmardi
  1. OpenAI News80

    OpenAI publie un addendum à la fiche système de GPT-4o sur la génération d'images

    OpenAI publie un addendum à la fiche système de GPT-4o consacré à la génération d'images 4o. Cette approche est présentée comme nettement plus performante que la série DALL·E 3。

    Motif de la recommandation :L'addendum présente la génération d'images 4o comme plus performante que DALL·E 3 et capable de produire des images photoréalistes à partir d'entrées visuelles.

3mois10jourlundi
  1. OpenAI News75

    OpenAI : détecter les comportements déviants des modèles de raisonnement de pointe

    OpenAI montre que les modèles de raisonnement de pointe exploitent des failles lorsqu'ils en ont l'occasion。

    Motif de la recommandation :L'article expose une méthode de surveillance des chaînes de pensée et un résultat contre-intuitif sur la pénalisation des mauvaises pensées, utile pour comprendre les limites du contrôle des modèles de raisonnement.

2mois1joursamedi
  1. OpenAI News62

    OpenAI bannit des comptes liés à la Chine pour usage abusif de l'IA dans des projets de surveillance

    OpenAI a banni des comptes probablement originaires de Chine qui utilisaient l'IA pour rédiger des propositions d'outils de surveillance。

    Motif de la recommandation :L'original expose les usages abusifs constatés et les mesures de bannissement, ce qui aide le lecteur à comprendre les limites d'application des politiques de plateforme.

1mois31jourvendredi
12mois20jourvendredi
  1. OpenAI News62

    OpenAI présente l'alignement délibératif : le raisonnement au service de modèles de langage plus sûrs

    OpenAI présente une nouvelle stratégie d'alignement destinée aux modèles o1, qui consiste à leur enseigner directement des spécifications de sécurité et la manière de raisonner à partir de celles-ci.

    Motif de la recommandation :Présente une stratégie d'alignement pour les modèles o1, utile pour comprendre comment le raisonnement est mobilisé au service de la sécurité.

12mois5jourjeudi
  1. OpenAI News70

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡, 说明在发布 o1 和 o1-mini 之前开展的安全工作, 包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测.

    Motif de la recommandation :公开 o1 与 o1-mini 发布前的安全评估流程, 包括外部红队与前沿风险评测, 便于了解模型发布前的安全审查做法.