Essai sur les limites du refus des IA
Pour commencer
MIT Technology Review rapporte un essai d'Arthur Holland Michel sur les mécanismes et limites du refus des modèles d'IA. Le refus est décrit comme le « mur porteur » de la sécurité des IA, mais probabiliste et peu fiable. En 2021, une équipe d'Anthropic écrivait que les LLM devaient être utiles, honnêtes et surtout inoffensifs. Plus tôt cette année, Anthropic a indiqué qu'un type de classificateur ajoutait 24 % aux coûts de calcul de ses chatbots. En juin, lors de la sortie de Fable 5, des chercheurs d'Amazon ont débloqué certaines capacités de piratage en moins de trois jours. En août, Anthropic a de nouveau assoupli ses marges de sécurité, admettant que construire des classificateurs « n'est pas une tâche simple ».
AI Généré à partir des reportages · 44 minmise à jour
Chronologie des reportages
Suivez les reportages pour découvrir les différentes facettes de l'événement.
- MIT Technology Review · AIMIT Technology Review : nous faisons trop confiance à la capacité de l'IA à dire non
Le refus est devenu le « mur porteur » de la sécurité des IA, mais il reste probabiliste et donc peu fiable. Anthropic prônait dès 2021 des LLM helpful.
Évolution des tendances de cet événement
Pas encore assez de données d'observation continues pour tracer une tendance.