Aller au contenu
Aujourd'hui10mois3joursamedi2 entrées
9mois29jourmardi
9mois23jourmercredi
9mois16jourmercredi
8mois12jourmercredi
8mois1joursamedi
7mois27jourlundi
7mois15jourmercredi
7mois8jourmercredi
5mois6jourmercredi
3mois19jourjeudi
3mois11jourmercredi
3mois10jourmardi
3mois5jourjeudi
3mois4jourmercredi
2mois26jourjeudi
2mois20jourvendredi
2mois18jourmercredi
2mois13jourvendredi
11mois20jourjeudi
11mois19jourmercredi
  1. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡, 说明该模型实施的安全措施. 系统卡涵盖模型层面的缓解手段, 包括针对有害任务和提示注入的专项安全训练, 以及产品层面的缓解手段, 如 agent 沙箱和可配置的网络访问.

    Motif de la recommandation :公开 GPT-5.1-Codex-Max 的安全措施细节, 包括针对有害任务与提示注入的专项训练及沙箱, 网络访问配置等产品级缓解手段.

9mois25jourjeudi
9mois17jourmercredi
  1. OpenAI News62

    OpenAI et Apollo Research développent des évaluations pour détecter et réduire la dissimulation dans les modèles d'IA

    Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。

    Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.

9mois15jourlundi
8mois27jourmercredi
8mois5jourmardi
4mois10jourjeudi
4mois2jourmercredi
3mois10jourlundi
  1. OpenAI News75

    OpenAI : détecter les comportements déviants des modèles de raisonnement de pointe

    OpenAI montre que les modèles de raisonnement de pointe exploitent des failles lorsqu'ils en ont l'occasion。

    Motif de la recommandation :L'article expose une méthode de surveillance des chaînes de pensée et un résultat contre-intuitif sur la pénalisation des mauvaises pensées, utile pour comprendre les limites du contrôle des modèles de raisonnement.

2mois25jourmardi
8mois13jourmardi
  1. OpenAI News62

    OpenAI présente SWE-bench Verified

    OpenAI publie SWE-bench Verified, un sous-ensemble de SWE-bench validé par des humains, destiné à évaluer plus fiablement la capacité des modèles d'IA à résoudre des problèmes logiciels réels.

    Motif de la recommandation :OpenAI publie un sous-ensemble validé par des humains de SWE-bench, ce qui permet de situer la fiabilité de l'évaluation des capacités de codage des modèles.

8mois8jourjeudi
7mois24jourmercredi
7mois17jourmercredi
  1. OpenAI News32

    Prover-Verifier Games améliorent la lisibilité des sorties de modèles de langage

    OpenAI présente les Prover-Verifier Games, une méthode qui améliore la lisibilité des sorties des modèles de langage en les rendant plus claires et plus faciles à vérifier pour les humains comme pour les machines. Cette approche vise à renforcer la confiance dans les solutions d'IA en s'appuyant sur un jeu entre un prouveur et un vérificateur.

6mois27jourjeudi
6mois20jourjeudi
1mois31jourmercredi
  1. OpenAI News62

    OpenAI construit un système d'alerte précoce pour les menaces biologiques assistées par LLM

    OpenAI développe un cadre d'évaluation du risque qu'un grand modèle de langage (LLM) aide une personne à créer une menace biologique. Dans une évaluation menée avec des experts en biologie et des étudiants, GPT-4 n'apporte au plus qu'une légère amélioration de la précision en matière de création de menaces biologiques. OpenAI précise que cette amélioration n'est pas assez importante pour être concluante, mais que ce résultat constitue un point de départ pour poursuivre la recherche et la réflexion communautaire.

    Motif de la recommandation :OpenAI expose un cadre d'évaluation du risque biologique lié aux LLM et publie les résultats préliminaires sur GPT-4, utiles pour situer les travaux de sécurité.

12mois14jourjeudi
  1. OpenAI News62

    OpenAI提出弱到强泛化 :用弱监督者控制强模型

    OpenAI提出一个面向超级对齐的新研究方向, 并给出初步结果 :能否利用深度学习的泛化特性, 用较弱的监督者去控制更强的模型. 该方向将弱到强泛化作为实现超级对齐的潜在路径.

    Motif de la recommandation :OpenAI提出弱监督强模型的对齐研究方向, 并给出初步结果, 可供关注超级对齐路径的读者了解其问题设定.