Aller au contenu

Orientations techniques

Sécurité et alignement Dernières actualités

Sécurité et alignement de l'IA : jailbreak et défenses, recherche sur le comportement des modèles, évaluations de sécurité et cadres de gouvernance.

189 sélections30 derniers jours 95 entréesTotal : 498 entrées

mise à jour

Archives de la sélection · page 10

28 juinmar.181–189 entrées
13 juinlun.
  1. OpenAI News62

    OpenAI entraîne des modèles de rédaction de critiques pour aider les humains à repérer les défauts des résumés

    OpenAI indique avoir entraîné des modèles de rédaction de critiques chargés de décrire les défauts dans les résumés. Les évaluateurs humains repèrent beaucoup plus souvent ces défauts lorsqu'on leur montre les critiques du modèle. Les modèles plus grands sont meilleurs pour s'autocritiquer, et l'augmentation d'échelle améliore davantage la rédaction de critiques que la rédaction de résumés. Cela ouvre une piste pour que des systèmes d'IA assistent la supervision humaine d'autres systèmes d'IA sur des tâches difficiles.

    Motif de la recommandation :Un modèle de rédaction de critiques aide les évaluateurs humains à repérer davantage de défauts dans les résumés, et l'échelle améliore davantage la critique que la rédaction.

27 janvierjeu.
8 septembremer.
5 novembremar.
19 septembrejeu.
  1. OpenAI News62

    OpenAI ajuste GPT-2 774M par les préférences humaines

    OpenAI a ajusté le modèle de langage GPT-2 de 774M paramètres à l'aide de retours humains pour diverses tâches.

    Motif de la recommandation :L'original expose les préférences humaines et le nombre d'annotations nécessaires pour différentes tâches, ce qui permet de comprendre le coût et les limites du fine-tuning par retour humain.

20 aoûtmar.
  1. OpenAI News83

    OpenAI publie GPT-2 774M et un accord juridique open source

    OpenAI publie le modèle de langage GPT-2 de 774 millions de paramètres, après la sortie du petit modèle 124M en février et la publication échelonnée du modèle moyen 355M en mai.

    Motif de la recommandation :L'article retrace le calendrier de publication par étapes de GPT-2 et expose un accord juridique open source pour les partenariats de partage de modèles.

3 maijeu.
20 févriermar.