Aller au contenu

Orientations techniques

Sécurité et alignement Dernières actualités

AI Sécurité et alignement de l'IA : jailbreak et défenses, recherche sur le comportement des modèles, évaluations de sécurité et cadres de gouvernance.

108 sélections30 derniers jours 8 entréesTotal : 358 entrées

mise à jour

Archives de la sélection · page 2

7mois16jourjeudi21–40 entrées
  1. Hugging Face Blog88

    Hugging Face révèle une intrusion menée par un système d'agent IA autonome

    Hugging Face a détecté et traité une intrusion dans une partie de son infrastructure de production。

    Motif de la recommandation :Le récit détaillé d'une intrusion menée par un agent autonome et des moyens de détection par LLM offre un retour d'expérience concret sur la défense des plateformes IA.

7mois9jourjeudi
  1. Google Research74

    Google Research présente SensorFM, un modèle de fondation pour les données de santé portables

    Google Research présente SensorFM, un grand modèle de fondation de capteurs pré-entraîné sur plus de mille milliards de minutes de signaux multimodaux issus de cinq millions de participants consentants, couvrant plus de 100 pays et plus de 20 modèles d'appareils Fitbit et Pixel Watch. Le modèle apprend par reconstruction auto-supervisée avec le cadre Adaptive and Inherited Masking (AIM), qui traite les données manquantes comme un artefact naturel plutôt que de les imputer ou de les écarter. Sur 35 tâches de santé issues de trois études prospectives totalisant 13 985 participants, les sondes linéaires sur les embeddings de SensorFM surpassent la baseline supervisée à caractéristiques d'ingénierie sur 34 tâches, et le plus grand modèle (SensorFM-B) réduit la perte de reconstruction de 31 % par rapport à la plus petite variante, avec un gain moyen de 9 % en AUC sur les tâches de classification et de 21 % en coefficient de Pearson sur les tâches de régression. Un système d'agents LLM collaboratifs et concurrents a exploré plus de 30 000 solutions candidates pour construire des têtes de prédiction, battant une sonde linéaire simple sur 16 des 20 tâches de classification et 12 des 15 tâches de régression. Intégré à un Personal Health Agent, SensorFM a permis des résumés de santé jugés significativement meilleurs que la baseline sur cinq dimensions par un panel de cliniciens, sans différence statistiquement significative avec l'utilisation de mesures de référence réelles.

    Motif de la recommandation :L'article détaille un modèle de fondation entraîné sur plus de mille milliards de minutes de données de capteurs, avec des gains mesurés sur 35 tâches de santé.

6mois26jourvendredi
6mois22jourlundi
  1. OpenAI News62

    OpenAI lance Daybreak, avec Codex Security et GPT-5.5-Cyber

    OpenAI présente les nouveaux outils Daybreak, dont Codex Security et GPT-5.5-Cyber, destinés à aider les organisations à trouver, valider et corriger les vulnérabilités à grande échelle.

    Motif de la recommandation :Présentation des nouveaux outils de sécurité d'OpenAI et de leur objectif de détection et de correction des vulnérabilités à grande échelle.

6mois19jourvendredi
6mois16jourmardi
  1. Google DeepMind62

    Google DeepMind publie l'AI Control Roadmap pour sécuriser les agents IA

    Google DeepMind présente son AI Control Roadmap, un cadre de défense en profondeur qui traite les agents internes comme potentiellement mal alignés et ajoute une couche de sécurité système au-delà de l'alignement des modèles. Le dispositif s'appuie sur un cadre de modélisation des menaces inspiré de MITRE ATT&CK, des superviseurs IA surveillant le raisonnement et les actions des agents, et des niveaux de détection D1-D4 et de prévention/réponse R1-R3 indexés sur les capacités du modèle. L'équipe indique avoir analysé un million de tâches d'agents de codage et utilisé ces données pour un moniteur en direct du agent Gemini Spark, la majorité des événements signalés provenant de mauvaises interprétations plutôt que d'une intention adverse. DeepMind publie en parallèle un cadre technique pour les décideurs, 'Three Layers of Agent Security'.

    Motif de la recommandation :Google DeepMind détaille son AI Control Roadmap et les niveaux D1-D4/R1-R3, une grille de sécurité des agents directement transposable à d'autres déploiements.

  2. OpenAI News60

    OpenAI 提出 Deployment Simulation, 用真实对话数据在发布前预测模型行为

    OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.

    Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.

6mois10jourmercredi
6mois5jourvendredi
  1. Hugging Face Blog65

    NVIDIA publie Nemotron 3.5 Content Safety, un modèle de sécurité multimodal personnalisable

    NVIDIA publie Nemotron 3.5 Content Safety, un modèle de sécurité de contenu multimodal et multilingue de 4B paramètres construit sur Gemma 3 4B IT。

    Motif de la recommandation :L'article détaille les capacités de sécurité multimodale et multilingue de Nemotron 3.5, ainsi que les modes d'inférence et les options de déploiement, ce qui aide le lecteur à évaluer son intégration dans des pipelines de production.

6mois1jourlundi
5mois17jourdimanche
5mois16joursamedi
  1. Google DeepMind78

    WeatherNext de Google DeepMind aide le National Hurricane Center à mieux prévoir l'atterrissage historique de l'ouragan Melissa en Jamaïque

    Le modèle météo IA WeatherNext de Google DeepMind et Google Research a aidé le National Hurricane Center à prévoir cinq jours à l'avance l'intensification rapide et l'atterrissage en Jamaïque de l'ouragan Melissa en catégorie 5, avec une confiance de 80 % portée à près de 100 % trois jours avant, une première pour un système partant d'une vitesse de vent de catégorie 1. Selon le rapport annuel de vérification du NHC, WeatherNext a été le meilleur modèle individuel de la saison 2025 pour la trajectoire et l'intensité. La collaboration se poursuit et les capacités de recherche sont étendues aux Philippines (PAGASA), Taïwan (CWA), l'Indonésie (BMKG) et le Vietnam (VNMHA), avec des projets au Japon, en Australie et en Inde.

    Motif de la recommandation :Le récit détaillé d'un cas réel montre comment un modèle météo IA a devancé les modèles traditionnels sur la trajectoire et l'intensité, avec des chiffres de confiance exploitables.

5mois7jourjeudi
  1. OpenAI News67

    OpenAI étend Trusted Access for Cyber avec GPT-5.5 et GPT-5.5-Cyber

    OpenAI étend Trusted Access for Cyber avec GPT-5.5 et GPT-5.5-Cyber, afin d'aider les défenseurs vérifiés à accélérer la recherche de vulnérabilités et à protéger les infrastructures critiques.

    Motif de la recommandation :L'original présente l'extension de l'accès vérifié pour la cyberdéfense et les modèles concernés, ce qui permet de suivre l'évolution des capacités et des conditions d'accès.

4mois30jourjeudi
  1. Google DeepMind62

    Google DeepMind lance l'initiative de recherche AI co-clinician pour explorer le modèle de soins triadiques

    Google DeepMind annonce l'initiative de recherche AI co-clinician, qui vise à faire de l'IA un membre collaboratif de l'équipe soignante。

    Motif de la recommandation :L'original expose la conception d'architecture et les résultats d'évaluation de l'IA co-clinicien, permettant de comprendre les capacités et les limites actuelles de l'IA dans les scénarios médicaux.

4mois23jourjeudi
4mois22jourmercredi
  1. OpenAI News62

    OpenAI publie Privacy Filter, un modèle à poids ouverts pour détecter et masquer les données personnelles

    OpenAI publie Privacy Filter, un modèle à poids ouverts destiné à détecter et masquer les informations personnelles identifiables (PII) dans du texte, avec une précision annoncée comme état de l'art.

    Motif de la recommandation :Un modèle à poids ouverts d'OpenAI dédié à la détection et à la suppression des données personnelles, avec un point d'entrée concret pour les flux de traitement de texte.

4mois14jourmardi
  1. OpenAI News60

    OpenAI étend Trusted Access for Cyber et ouvre GPT-5.4-Cyber aux défenseurs vérifiés

    OpenAI annonce l'extension de son programme Trusted Access for Cyber et l'introduction de GPT-5.4-Cyber pour les défenseurs vérifiés. L'entreprise indique renforcer les garde-fous à mesure que les capacités de cybersécurité de l'IA progressent.

    Motif de la recommandation :L'original expose l'extension du programme Trusted Access for Cyber et l'ouverture de GPT-5.4-Cyber aux défenseurs vérifiés, ce qui permet de suivre l'usage de l'IA en cybersécurité.

4mois10jourvendredi
3mois31jourmardi
  1. Google Research75

    Google Quantum AI publie un livre blanc sur la vulnérabilité quantique des cryptomonnaies

    Google Quantum AI a publié un livre blanc montrant que de futurs ordinateurs quantiques pourraient casser la cryptographie à courbes elliptiques protégeant les cryptomonnaies avec moins de qubits et de portes que estimé auparavant. Les circuits compilés pour l'algorithme de Shor sur ECDLP-256 utilisent moins de 1 200 qubits logiques et 90 millions de portes Toffoli, ou moins de 1 450 qubits logiques et 70 millions de portes Toffoli, exécutables en quelques minutes sur un CRQC supraconducteur de moins de 500 000 qubits physiques, soit une réduction d'environ 20 fois du nombre de qubits physiques nécessaires. Google recommande la transition des blockchains vers la cryptographie post-quantique (PQC) et a développé une preuve à divulgation nulle de connaissance pour permettre la vérification des vulnérabilités sans fournir de feuille de route aux acteurs malveillants, en collaboration avec le gouvernement américain et selon une échéance 2029.

    Motif de la recommandation :Google Quantum AI détaille les ressources quantiques nécessaires pour casser ECDLP-256 et propose une divulgation par preuve à divulgation nulle de connaissance.

3mois26jourjeudi
  1. Google DeepMind62

    Google DeepMind publie une étude sur la manipulation nuisible par l'IA et un outil de mesure validé

    Google DeepMind publie de nouveaux résultats sur le risque que l'IA soit détournée à des fins de manipulation nuisible。

    Motif de la recommandation :L'étude fournit un outil de mesure validé empiriquement et ouvre ses supports, ce qui permet de reproduire et d'étendre l'évaluation de la manipulation nuisible.