Aller au contenu
Aujourd'hui10mois3joursamedi2 entrées
  1. The Decoder76

    BootLoops, un harnais open source pour des calculs scientifiques exacts avec l'IA

    Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.

    Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.

10mois2jourvendredi
  1. Google Research67

    Google présente un système d'apprentissage fédéré basé sur les TEE pour une confidentialité vérifiable

    Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).

    Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.

  2. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

10mois1jourjeudi
  1. Microsoft Research38

    Microsoft Research : prévision des risques météorologiques spatiales sur les réseaux électriques

    Un système d'apprentissage automatique développé lors d'un stage chez Microsoft Research prévoit les risques météorologiques spatiaux pour 66 935 sous-stations du réseau électrique continental américain, avec une alerte de 30 à 60 minutes avant l'impact. Le pipeline combine les prévisions des indices AE et Dst, la conductivité géologique locale et les données d'infrastructure, atteignant un RMSE de 410,2 nT pour l'AE et surpassant l'équation de Burton sur 62,2 % des heures lors des périodes les plus actives de 2020-2026. Il détecte 76,5 % des événements majeurs (≥10 nT/min), 81,2 % des événements sévères (≥20 nT/min) et 64,1 % des événements extrêmes (≥50 nT/min), avec des taux de fausses alertes croissant avec la sévérité.

9mois30jourmercredi
  1. Google DeepMind73

    Google DeepMind présente SynthID Bio, une technologie de filigrane pour les protéines générées par IA

    Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.

    Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.

9mois29jourmardi
9mois21jourlundi
  1. Microsoft Research60

    Microsoft Research publie RetroChimera dans Nature pour améliorer la prédiction de synthèse des petites molécules

    Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.

    Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.

9mois18jourvendredi
9mois16jourmercredi
9mois11jourvendredi
9mois4jourvendredi
8mois12jourmercredi
8mois1joursamedi
7mois27jourlundi
7mois26jourdimanche
6mois30jourmardi
6mois18jourjeudi
6mois17jourmercredi
6mois16jourmardi
  1. OpenAI News60

    OpenAI 提出 Deployment Simulation, 用真实对话数据在发布前预测模型行为

    OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.

    Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.

4mois25joursamedi
3mois13jourvendredi
  1. Berkeley AI Research36

    SPEX et ProxySPEX : identifier les interactions à grande échelle pour les LLM

    Berkeley AI Research présente SPEX et ProxySPEX, des algorithmes d'attribution capables d'identifier les interactions influentes dans les LLM à une échelle bien supérieure aux méthodes antérieures. SPEX exploite la parcimonie et le faible degré des interactions pour reformuler la recherche exhaustive en un problème de recouvrement parcimonieux résolu via des outils de traitement du signal et de théorie du codage. ProxySPEX tire parti de la propriété de hiérarchie des modèles et atteint les performances de SPEX avec environ 10x moins d'ablations. Sur une tâche d'analyse de sentiment, SPEX conserve une fidélité élevée lorsque le contexte atteint des milliers de features, là où LIME et Banzhaf affichent une fidélité nettement inférieure.

3mois10jourmardi
2mois13jourvendredi
2mois5jourjeudi
  1. OpenAI News65

    GPT-5 réduit le coût de la synthèse de protéines sans cellules

    Un laboratoire autonome combinant GPT-5 d'OpenAI avec l'automatisation cloud de Ginkgo Bioworks a réduit de 40 % le coût de la synthèse de protéines sans cellules grâce à une expérimentation en boucle fermée.

    Motif de la recommandation :Un laboratoire autonome combinant GPT-5 et l'automatisation cloud de Ginkgo Bioworks réduit de 40 % le coût de la synthèse de protéines sans cellules.

1mois10joursamedi
12mois16jourmardi
  1. OpenAI News38

    OpenAI mesure la capacité de l'IA à accélérer la recherche biologique

    OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.

11mois20jourjeudi
11mois4jourmardi
10mois29jourmercredi
9mois17jourmercredi
  1. OpenAI News62

    OpenAI et Apollo Research développent des évaluations pour détecter et réduire la dissimulation dans les modèles d'IA

    Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。

    Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.

8mois5jourmardi
6mois18jourmercredi
  1. OpenAI News50

    OpenAI研究 :训练数据中的错误回答如何导致模型misalignment泛化

    OpenAI研究发现, 在错误回答上训练语言模型会导致更广泛的misalignment行为, 并识别出一个驱动该行为的内部特征, 通过极少量fine-tuning即可将其逆转. 该研究聚焦于错误训练数据引发misalignment泛化的机制, 为理解和预防此类问题提供了可操作的干预方向.

5mois12jourlundi
10mois10jourjeudi
6mois20jourjeudi
6mois6jourjeudi