Red-Teaming des grands modèles de langage
Le red-teaming des LLM consiste à concevoir des prompts déclenchant des comportements nuisibles — divulgation d'informations personnelles。
Le red-teaming des LLM consiste à concevoir des prompts déclenchant des comportements nuisibles — divulgation d'informations personnelles。
OpenAI précise comment le comportement de ChatGPT est façonné et annonce ses plans pour l'améliorer。
OpenAI lance un classificateur entraîné à distinguer les textes écrits par IA des textes écrits par des humains.
Hugging Face a publié une analyse des techniques derrière ChatGPT — RLHF, IFT, CoT。
OpenAI研究人员与乔治城大学安全与新兴技术中心及斯坦福互联网观察站合作, 研究了大型语言模型可能被滥用于虚假信息活动的风险. 该合作包括2021年10月汇集30名虚假信息研究者, 机器学习专家和政策分析师的工作坊, 并最终形成一份基于一年多研究的联合报告. 报告概述了语言模型若被用于增强虚假信息活动对信息环境构成的威胁, 并提出了分析潜在缓解措施的框架.
Hugging Face publie le deuxième numéro de sa newsletter Éthique et Société consacré aux biais en machine learning。
Hugging Face ajoute à la bibliothèque 🤗 Evaluate des métriques et mesures de biais。
Hugging Face lance une newsletter trimestrielle « Ethics and Society », publiée à chaque équinoxe et solstice。
Hugging Face soutient OpenRAIL, une famille de licences spécifiques à l'IA qui permettent l'accès。
OpenAI déclare améliorer la capacité de ses systèmes d'IA à apprendre des retours humains et à aider les humains à évaluer l'IA. L'objectif affiché est de construire un système d'IA suffisamment aligné pour aider à résoudre tous les autres problèmes d'alignement.
OpenAI annonce la mise en œuvre d'une nouvelle technique afin que DALL·E génère des images de personnes reflétant plus fidèlement la diversité de la population mondiale. Cette mise à jour s'inscrit dans les efforts de réduction des biais et d'amélioration de la sécurité du modèle.
OpenAI présente les mesures de pré-entraînement de DALL·E 2。
Motif de la recommandation :L'article expose les garde-fous mis en place avant l'ouverture de DALL·E 2, un cas concret de réduction des risques d'un modèle de génération d'images.
OpenAI indique avoir entraîné des modèles de rédaction de critiques chargés de décrire les défauts dans les résumés. Les évaluateurs humains repèrent beaucoup plus souvent ces défauts lorsqu'on leur montre les critiques du modèle. Les modèles plus grands sont meilleurs pour s'autocritiquer, et l'augmentation d'échelle améliore davantage la rédaction de critiques que la rédaction de résumés. Cela ouvre une piste pour que des systèmes d'IA assistent la supervision humaine d'autres systèmes d'IA sur des tâches difficiles.
Motif de la recommandation :Un modèle de rédaction de critiques aide les évaluateurs humains à repérer davantage de défauts dans les résumés, et l'échelle améliore davantage la critique que la rédaction.
Le groupe de recherche multimodal de Hugging Face a formalisé une charte éthique pour son projet multimodal。
Hugging Face研究科学家Sasha Luccioni在播客访谈中介绍了她在Big Science项目中主持碳足迹工作组的工作, 研究范围涵盖GPU训练时长。
Hugging Face publie la deuxième partie de sa série d'entretiens avec des directeurs Machine Learning。
OpenAI 发文探讨在优化难以或高成本衡量的目标时如何应对 Goodhart 定律, 即“当一个度量标准成为目标时, 它就不再是一个好的度量标准”. 该定律最初源自经济学, OpenAI 在确定优化目标时同样需要面对这一问题.
Margaret Mitchell, fondatrice et co-responsable du groupe Ethical AI de Google, a rejoint Hugging Face après quatre ans chez Google pour y créer des protocoles de recherche en IA éthique。
OpenAI décrit sa réflexion la plus récente sur la sécurité et les usages abusifs des modèles déployés, dans l'espoir d'aider d'autres développeurs d'IA à traiter ces questions.
OpenAI annonce avoir entraîné des modèles de langage bien meilleurs que GPT-3 pour suivre les intentions des utilisateurs。
Motif de la recommandation :OpenAI déploie InstructGPT comme modèle par défaut de son API, avec des améliorations sur le suivi des instructions, la véracité et la toxicité.
TruthfulQA est un benchmark proposé par OpenAI pour mesurer dans quelle mesure les modèles de langage reproduisent les fausses croyances humaines. Le contenu source ne fournit que le titre。
OpenAI montre qu'un fine-tuning sur un petit dataset curé suffit à améliorer le comportement d'un modèle de langage sur des valeurs comportementales spécifiques. La recherche s'appuie sur un dataset restreint et sélectionné, sans préciser de modèle, de version ni de score de benchmark.
OpenAI与30个组织的58位合著者共同发布了一份多利益相关方报告, 提出10项提升AI系统声明可验证性的机制. 这些机制可供开发者提供AI系统安全, 可靠, 公平或隐私保护方面的证据, 也可供用户, 政策制定者和公民社会评估AI开发流程.
OpenAI publie Safety Gym, une suite d'environnements et d'outils destinée à mesurer les progrès vers des agents d'apprentissage par renforcement qui respectent des contraintes de sécurité pendant l'entraînement.
OpenAI publie la plus grande version de GPT-2, avec 1,5 milliard de paramètres。
Motif de la recommandation :La publication de la version complète de GPT-2 1.5B et de ses poids permet de comprendre le processus de publication échelonnée et ses implications pour la détection des sorties.
OpenAI a ajusté le modèle de langage GPT-2 de 774M paramètres à l'aide de retours humains pour diverses tâches。
Motif de la recommandation :L'original expose les préférences humaines et le nombre d'annotations nécessaires pour différentes tâches, ce qui permet de comprendre le coût et les limites du fine-tuning par retour humain.
OpenAI提出一种评估神经网络分类器能否可靠抵御训练中未见对抗攻击的方法, 并由此得出新指标UAR (Unforeseen Attack Robustness), 用于衡量单一模型面对未预期攻击时的鲁棒性. 该方法强调需要在更多样化的未知攻击范围内衡量模型表现.
OpenAI publie le modèle de langage GPT-2 de 774 millions de paramètres, après la sortie du petit modèle 124M en février et la publication échelonnée du modèle moyen 355M en mai。
Motif de la recommandation :L'article retrace le calendrier de publication par étapes de GPT-2 et expose un accord juridique open source pour les partenariats de partage de modèles.
OpenAI a publié un document de recherche politique identifiant quatre stratégies pour améliorer la coopération industrielle à long terme sur les normes de sécurité en IA 。
OpenAI publie un article affirmant que la recherche sur la sécurité à long terme de l'IA nécessite la collaboration de spécialistes des sciences sociales pour garantir le succès des algorithmes d'alignement lorsque de véritables humains sont impliqués. L'alignement des systèmes d'IA avancés sur les valeurs humaines exige de lever de nombreuses incertitudes liées à la psychologie de la rationalité, des émotions et des biais humains. OpenAI prévoit de recruter des spécialistes des sciences sociales pour travailler à plein temps sur ce sujet et entend stimuler la collaboration entre chercheurs en machine learning et en sciences sociales.
OpenAI propose une technique de sûreté IA appelée iterated amplification。
OpenAI propose une technique de sécurité de l'IA qui entraîne des agents à débattre entre eux sur un sujet, un humain jugeant qui gagne.
Motif de la recommandation :L'article expose une piste d'alignement où des agents débattent sous supervision humaine, utile pour situer les approches de sécurité de l'IA.
OpenAI annonce avoir co-écrit un article qui anticipe la manière dont des acteurs malveillants pourraient détourner la technologie IA。
OpenAI a publié RL-Teacher, une implémentation open source de son interface permettant d'entraîner des IA via des retours humains occasionnels plutôt que des fonctions de récompense écrites à la main. La technique sous-jacente a été développée comme une étape vers des systèmes d'IA sûrs, et s'applique aussi aux problèmes d'apprentissage par renforcement dont les récompenses sont difficiles à spécifier.
OpenAI 创建了在不同尺度和视角下都能可靠欺骗神经网络分类器的图像, 直接挑战了上周提出的观点, 即自动驾驶汽车因从多尺度, 多角度, 多视角等采集图像而难以被恶意欺骗.
OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.
Les exemples adversariaux sont des entrées conçues intentionnellement par un attaquant pour faire commettre une erreur au modèle d'apprentissage automatique。
OpenAI décrit un mode de défaillance de l'apprentissage par renforcement 。
OpenAI与Berkeley, Stanford的研究人员共同参与了一篇由Google Brain研究人员主导的论文« Concrete Problems in AI Safety ». 该论文探讨了围绕确保现代机器学习系统按预期运行的诸多研究问题.
OpenAI a défini ses objectifs techniques dans le cadre de sa mission : construire une IA sûre et veiller à ce que ses bénéfices soient répartis de manière aussi large et équitable que possible.