Aller au contenu

Orientations techniques

Sécurité et alignement Dernières actualités

Sécurité et alignement de l'IA : jailbreak et défenses, recherche sur le comportement des modèles, évaluations de sécurité et cadres de gouvernance.

131 sélections30 derniers jours 37 entréesTotal : 380 entrées

mise à jour

Archives de la sélection · page 7

23 maimar.121–131 entrées
  1. Hugging Face Blog67

    Hugging Face, EleutherAI et Stability AI font de safetensors le format par défaut après un audit de sécurité externe

    Hugging Face, EleutherAI et Stability AI ont commandé un audit de sécurité externe de la bibliothèque safetensors.

    Motif de la recommandation :L'audit externe confirme l'absence de faille critique et le passage de safetensors au statut de dépendance par défaut dans transformers.

24 févrierven.
28 juinmar.
13 juinlun.
  1. OpenAI News62

    OpenAI entraîne des modèles de rédaction de critiques pour aider les humains à repérer les défauts des résumés

    OpenAI indique avoir entraîné des modèles de rédaction de critiques chargés de décrire les défauts dans les résumés. Les évaluateurs humains repèrent beaucoup plus souvent ces défauts lorsqu'on leur montre les critiques du modèle. Les modèles plus grands sont meilleurs pour s'autocritiquer, et l'augmentation d'échelle améliore davantage la rédaction de critiques que la rédaction de résumés. Cela ouvre une piste pour que des systèmes d'IA assistent la supervision humaine d'autres systèmes d'IA sur des tâches difficiles.

    Motif de la recommandation :Un modèle de rédaction de critiques aide les évaluateurs humains à repérer davantage de défauts dans les résumés, et l'échelle améliore davantage la critique que la rédaction.

27 janvierjeu.
8 septembremer.
5 novembremar.
19 septembrejeu.
  1. OpenAI News62

    OpenAI ajuste GPT-2 774M par les préférences humaines

    OpenAI a ajusté le modèle de langage GPT-2 de 774M paramètres à l'aide de retours humains pour diverses tâches.

    Motif de la recommandation :L'original expose les préférences humaines et le nombre d'annotations nécessaires pour différentes tâches, ce qui permet de comprendre le coût et les limites du fine-tuning par retour humain.

20 aoûtmar.
  1. OpenAI News83

    OpenAI publie GPT-2 774M et un accord juridique open source

    OpenAI publie le modèle de langage GPT-2 de 774 millions de paramètres, après la sortie du petit modèle 124M en février et la publication échelonnée du modèle moyen 355M en mai.

    Motif de la recommandation :L'article retrace le calendrier de publication par étapes de GPT-2 et expose un accord juridique open source pour les partenariats de partage de modèles.

3 maijeu.
20 févriermar.