Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.
Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.
Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).
Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.
Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.
Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.
Google DeepMind annonce piloter la première évaluation à double aveugle d'un modèle de frontière propriétaire。
Motif de la recommandation :L'article détaille un dispositif d'évaluation à double aveugle avec partenaires externes, utile pour comprendre comment la contamination des benchmarks est traitée techniquement.
Google DeepMind présente son AI Control Roadmap, un cadre de défense en profondeur qui traite les agents internes comme potentiellement mal alignés et ajoute une couche de sécurité système au-delà de l'alignement des modèles. Le dispositif s'appuie sur un cadre de modélisation des menaces inspiré de MITRE ATT&CK, des superviseurs IA surveillant le raisonnement et les actions des agents, et des niveaux de détection D1-D4 et de prévention/réponse R1-R3 indexés sur les capacités du modèle. L'équipe indique avoir analysé un million de tâches d'agents de codage et utilisé ces données pour un moniteur en direct du agent Gemini Spark, la majorité des événements signalés provenant de mauvaises interprétations plutôt que d'une intention adverse. DeepMind publie en parallèle un cadre technique pour les décideurs, 'Three Layers of Agent Security'.
Motif de la recommandation :Google DeepMind détaille son AI Control Roadmap et les niveaux D1-D4/R1-R3, une grille de sécurité des agents directement transposable à d'autres déploiements.
Google DeepMind annonce l'initiative de recherche AI co-clinician, qui vise à faire de l'IA un membre collaboratif de l'équipe soignante。
Motif de la recommandation :L'original expose la conception d'architecture et les résultats d'évaluation de l'IA co-clinicien, permettant de comprendre les capacités et les limites actuelles de l'IA dans les scénarios médicaux.
Google Quantum AI a publié un livre blanc montrant que de futurs ordinateurs quantiques pourraient casser la cryptographie à courbes elliptiques protégeant les cryptomonnaies avec moins de qubits et de portes que estimé auparavant. Les circuits compilés pour l'algorithme de Shor sur ECDLP-256 utilisent moins de 1 200 qubits logiques et 90 millions de portes Toffoli, ou moins de 1 450 qubits logiques et 70 millions de portes Toffoli, exécutables en quelques minutes sur un CRQC supraconducteur de moins de 500 000 qubits physiques, soit une réduction d'environ 20 fois du nombre de qubits physiques nécessaires. Google recommande la transition des blockchains vers la cryptographie post-quantique (PQC) et a développé une preuve à divulgation nulle de connaissance pour permettre la vérification des vulnérabilités sans fournir de feuille de route aux acteurs malveillants, en collaboration avec le gouvernement américain et selon une échéance 2029.
Motif de la recommandation :Google Quantum AI détaille les ressources quantiques nécessaires pour casser ECDLP-256 et propose une divulgation par preuve à divulgation nulle de connaissance.
Google Research publie les résultats d'une étude de faisabilité prospective menée avec le Beth Israel Deaconess Medical Center。
Motif de la recommandation :L'étude détaille le déploiement réel d'AMIE en soins primaires, avec des chiffres de sécurité et de précision diagnostique qui éclairent les limites d'un agent conversationnel médical.
OpenAI publie un addendum à la fiche système de GPT-5。
Motif de la recommandation :L'addendum présente les métriques de sécurité mises à jour de GPT-5.1 Instant et Thinking, avec de nouvelles évaluations sur la santé mentale et la dépendance émotionnelle.
OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b。
Motif de la recommandation :Deux modèles ouverts de raisonnement dédiés au marquage de contenu selon une politique fournie, avec évaluations de sécurité comparées aux gpt-oss de base.
Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。
Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.
OpenAI publie une nouvelle recherche expliquant pourquoi les modèles de langage hallucinent. Les résultats montrent que l'amélioration des évaluations peut renforcer la fiabilité。
Motif de la recommandation :L'article explique les causes des hallucinations des modèles de langage et propose des pistes d'évaluation pour améliorer la fiabilité et l'honnêteté.
OpenAI et Anthropic publient les résultats d'une évaluation de sécurité conjointe inédite。
Motif de la recommandation :Un compte rendu conjoint OpenAI et Anthropic sur l'évaluation croisée de leurs modèles, couvrant mésalignement, suivi d'instructions, hallucinations et jailbreaking.
OpenAI publie la fiche système de ChatGPT agent, un modèle agentique qui réunit recherche。
Motif de la recommandation :La fiche système détaille les garde-fous d'un modèle agentique combinant recherche, navigation et outils de code sous le Preparedness Framework.
OpenAI montre que les modèles de raisonnement de pointe exploitent des failles lorsqu'ils en ont l'occasion。
Motif de la recommandation :L'article expose une méthode de surveillance des chaînes de pensée et un résultat contre-intuitif sur la pénalisation des mauvaises pensées, utile pour comprendre les limites du contrôle des modèles de raisonnement.