OpenAI déjoue une campagne coordonnée de distillation de modèle
OpenAI indique avoir déjoué une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles, et renforce ses défenses contre la distillation adverse.
OpenAI indique avoir déjoué une campagne coordonnée visant à extraire le raisonnement protégé de ses modèles, et renforce ses défenses contre la distillation adverse.
Google DeepMind détaille une évolution de son architecture Private AI Compute qui ajoute une couche de mémoire persistante côté serveur.
Motif de la recommandation :L'article détaille l'architecture de mémoire persistante côté serveur de Google et ses mécanismes de chiffrement, utile pour comprendre comment concilier continuité multi-appareils et confidentialité.
OpenAI présente un cadre pour suivre, enquêter et divulguer le désalignement des modèles, accompagné de six rapports portant sur des comportements de modèle inattendus ou préoccupants.
Motif de la recommandation :Un cadre de suivi et de divulgation du désalignement des modèles, accompagné de six rapports de comportements inattendus, utile pour comprendre les pratiques de sécurité des modèles.
OpenAI partage les conclusions de l'incident de sécurité Hugging Face ainsi que les mesures prises pour renforcer la sécurité, la surveillance et l'alignement des modèles d'IA.
Hugging Face a détecté et traité une intrusion dans une partie de son infrastructure de production。
Motif de la recommandation :Le récit détaillé d'une intrusion menée par un agent autonome et des moyens de détection par LLM offre un retour d'expérience concret sur la défense des plateformes IA.
OpenAI publie un nouveau rapport détaillant des opérations d'influence liées à la RPC qui utilisent l'IA pour cibler les débats technologiques américains。
OpenAI封禁了一个疑似源自中国的账号集群, 该集群利用AI生成社交媒体内容, 批评美国数据中心和AI基础设施.
Le modèle météo IA WeatherNext de Google DeepMind et Google Research a aidé le National Hurricane Center à prévoir cinq jours à l'avance l'intensification rapide et l'atterrissage en Jamaïque de l'ouragan Melissa en catégorie 5, avec une confiance de 80 % portée à près de 100 % trois jours avant, une première pour un système partant d'une vitesse de vent de catégorie 1. Selon le rapport annuel de vérification du NHC, WeatherNext a été le meilleur modèle individuel de la saison 2025 pour la trajectoire et l'intensité. La collaboration se poursuit et les capacités de recherche sont étendues aux Philippines (PAGASA), Taïwan (CWA), l'Indonésie (BMKG) et le Vietnam (VNMHA), avec des projets au Japon, en Australie et en Inde.
Motif de la recommandation :Le récit détaillé d'un cas réel montre comment un modèle météo IA a devancé les modèles traditionnels sur la trajectoire et l'intensité, avec des chiffres de confiance exploitables.
OpenAI a réagi à l'attaque de la chaîne d'approvisionnement visant Axios en renouvelant les certificats de signature de code macOS et en mettant à jour ses applications。
OpenAI lance un programme Safety Bug Bounty destiné à identifier les abus et risques de sécurité liés à l'IA。
Motif de la recommandation :OpenAI ouvre un programme de prime pour signaler les abus et risques de sécurité liés aux agents, ce qui éclaire les priorités de sécurité des déploiements agentiques.
OpenAI annonce l'acquisition de Promptfoo, une plateforme de sécurité IA qui aide les entreprises à identifier et corriger les vulnérabilités de leurs systèmes d'IA pendant le développement.
Motif de la recommandation :Une acquisition d'OpenAI dans la sécurité des systèmes d'IA, qui éclaire le positionnement des plateformes de test de vulnérabilités.
OpenAI a conclu un contrat avec le ministère de la Guerre, dont les détails portent sur les lignes rouges de sécurité。
Motif de la recommandation :L'accord entre OpenAI et le ministère de la Guerre précise les lignes rouges de sécurité et les protections juridiques encadrant le déploiement de l'IA en environnement classifié.
Google Research annonce, en partenariat avec Included Health, le lancement d'une étude randomisée nationale prospective avec consentement。
Motif de la recommandation :L'original expose le passage de la simulation à un essai randomisé national en soins virtuels réels, avec les étapes de recherche qui le précèdent.
OpenAI a banni des comptes utilisant l'IA pour soutenir des chaînes d'arnaques sentimentales。
Motif de la recommandation :L'original précise les maillons de la chaîne d'arnaque sentimentale assistée par IA et les mesures de bannissement d'OpenAI, ce qui aide le lecteur à comprendre les limites d'usage des modèles.
OpenAI a banni des comptes liés au réseau Rybar, dont certains proviendraient probablement de Russie。
OpenAI renforce ChatGPT Atlas contre les attaques d'injection de prompt en s'appuyant sur un red teaming automatisé entraîné par apprentissage par renforcement. Cette boucle proactive de découverte et de correction vise à identifier en amont de nouveaux exploits et à durcir les défenses de l'agent navigateur à mesure que l'IA devient plus agentique.
Motif de la recommandation :L'original expose la boucle automatique de red teaming et de correction d'Atlas, ce qui permet de comprendre comment les défenses d'un agent navigateur sont renforcées.
Google DeepMind annonce un partenariat renforcé avec le gouvernement britannique pour accélérer l'usage de l'IA dans la science。
Motif de la recommandation :Le partenariat détaille des accès prioritaires à des modèles scientifiques et un laboratoire automatisé, ce qui éclaire la trajectoire de l'IA appliquée à la recherche publique.
OpenAI a collaboré avec plus de 170 experts en santé mentale pour améliorer la capacité de ChatGPT à reconnaître la détresse。
Motif de la recommandation :L'original expose la collaboration avec plus de 170 experts en santé mentale et la baisse des réponses dangereuses, ce qui permet de juger de l'orientation de ChatGPT sur les sujets sensibles.
OpenAI a banni des comptes liés à une opération d'origine chinoise non signalée auparavant。
OpenAI a banni des comptes liés à la Chine qui utilisaient l'IA pour soutenir des activités de planification de surveillance。
Motif de la recommandation :L'annonce précise le type de comptes bannis et les usages visés, ce qui éclaire les modalités de modération des usages abusifs.