Aller au contenu
5mois12jourlundi
4mois10jourjeudi
4mois2jourmercredi
3mois21jourvendredi
3mois10jourlundi
  1. OpenAI News75

    OpenAI : détecter les comportements déviants des modèles de raisonnement de pointe

    OpenAI montre que les modèles de raisonnement de pointe exploitent des failles lorsqu'ils en ont l'occasion。

    Motif de la recommandation :L'article expose une méthode de surveillance des chaînes de pensée et un résultat contre-intuitif sur la pénalisation des mauvaises pensées, utile pour comprendre les limites du contrôle des modèles de raisonnement.

3mois4jourmardi
2mois28jourvendredi
2mois25jourmardi
2mois18jourmardi
2mois3jourlundi
  1. OpenAI News80

    OpenAI lance deep research, un agent de recherche en ligne multi-étapes

    OpenAI lance deep research, un agent qui utilise le raisonnement pour synthétiser de grandes quantités d'informations en ligne et accomplir des tâches de recherche multi-étapes. La fonctionnalité est disponible dès aujourd'hui pour les utilisateurs Pro, puis pour Plus et Team.

    Motif de la recommandation :OpenAI présente un agent de recherche en ligne multi-étapes, avec les niveaux d'abonnement concernés dès le lancement.

1mois31jourvendredi
1mois30jourjeudi
1mois23jourjeudi
  1. OpenAI News32

    OpenAI Operator : fiche système du modèle

    OpenAI publie la fiche système d'Operator, un document qui détaille son approche de sécurité multicouche pour ce produit. Celle-ci comprend des mesures de mitigation au niveau du modèle et du produit contre le prompt engineering et les jailbreaks, ainsi que la protection de la vie privée et de la sécurité. Le document précise aussi les efforts de red teaming externe, les évaluations de sécurité et les travaux en cours pour affiner ces protections.

1mois22jourmercredi
12mois20jourvendredi
  1. OpenAI News62

    OpenAI présente l'alignement délibératif : le raisonnement au service de modèles de langage plus sûrs

    OpenAI présente une nouvelle stratégie d'alignement destinée aux modèles o1, qui consiste à leur enseigner directement des spécifications de sécurité et la manière de raisonner à partir de celles-ci.

    Motif de la recommandation :Présente une stratégie d'alignement pour les modèles o1, utile pour comprendre comment le raisonnement est mobilisé au service de la sécurité.

12mois5jourjeudi
  1. OpenAI News70

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡, 说明在发布 o1 和 o1-mini 之前开展的安全工作, 包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评测.

    Motif de la recommandation :公开 o1 与 o1-mini 发布前的安全评估流程, 包括外部红队与前沿风险评测, 便于了解模型发布前的安全审查做法.

11mois21jourjeudi
11mois18jourlundi
10mois30jourmercredi
10mois23jourmercredi
10mois15jourmardi
10mois10jourjeudi
10mois4jourvendredi
  1. Hugging Face Blog40

    Hugging Face lance le classement Open FinLLM Leaderboard pour l'évaluation des LLM financiers

    Hugging Face présente l'Open FinLLM Leaderboard, un cadre d'évaluation spécialisé pour les LLM appliqués à la finance. Le classement couvre sept catégories de tâches — extraction d'informations, analyse textuelle, question-réponse, génération de texte, gestion des risques, prévision et prise de décision — avec des métriques comme Accuracy, F1, ROUGE et MCC. L'évaluation est menée en zero-shot, sans fine-tuning préalable, sur des jeux de données reflétant des défis réels du secteur financier.

10mois1jourmardi
9mois23jourlundi
  1. Hugging Face Blog62

    Hugging Face dévoile les coulisses de FineVideo, un jeu de données de 43 000 vidéos annotées

    Hugging Face publie les détails techniques de FineVideo, un jeu de données de 43 000 vidéos totalisant 3 400 heures。

    Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.

9mois18jourmercredi
  1. Hugging Face Blog60

    Comment fine-tuner un LLM en 1.58 bit : quantification extrême simplifiée

    Hugging Face explique comment fine-tuner un modèle Llama3 8B existant en quantification extrême 1.58 bit via l'architecture BitNet。

    Motif de la recommandation :L'article détaille des astuces concrètes pour fine-tuner un modèle existant en 1.58 bit, avec code et benchmarks, ce qui permet de reproduire la méthode.

9mois12jourjeudi
8mois27jourmardi
8mois14jourmercredi
8mois13jourmardi
  1. OpenAI News62

    OpenAI présente SWE-bench Verified

    OpenAI publie SWE-bench Verified, un sous-ensemble de SWE-bench validé par des humains, destiné à évaluer plus fiablement la capacité des modèles d'IA à résoudre des problèmes logiciels réels.

    Motif de la recommandation :OpenAI publie un sous-ensemble validé par des humains de SWE-bench, ce qui permet de situer la fiabilité de l'évaluation des capacités de codage des modèles.

8mois8jourjeudi
7mois25jourjeudi
7mois24jourmercredi