Berkeley AI Research : conception de systèmes d'imagerie guidée par l'information
Berkeley AI Research propose un cadre qui évalue et optimise directement les systèmes d'imagerie selon leur contenu informationnel.
Berkeley AI Research propose un cadre qui évalue et optimise directement les systèmes d'imagerie selon leur contenu informationnel.
OpenAI发布FrontierScience, 一个测试AI在物理, 化学和生物学领域推理能力的基准, 用于衡量AI在真实科学研究方面的进展.
OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.
Google a organisé avec SisonkeBiotik, Ro'ya et DS-I Africa un Ideathon panafricain Data Science for Health。
OpenAI annonce l'acquisition de Neptune afin de mieux observer le comportement des modèles et de renforcer les outils utilisés par les chercheurs pour suivre les expériences et surveiller l'entraînement.
Motif de la recommandation :L'acquisition vise à renforcer le suivi des expériences et la surveillance de l'entraînement, un point d'observation de l'outillage des laboratoires de modèles.
OpenAI présente les premiers cas de recherche montrant comment GPT-5 accélère les progrès scientifiques en mathématiques。
Google annonce un modèle de prédiction du risque de déforestation à une résolution de 30 mètres。
Google Research annonce ForestCast, un modèle de deep learning fondé sur des vision transformers qui prédit le risque de déforestation à partir de données satellitaires brutes Landsat et Sentinel 2, sans cartes auxiliaires. Le modèle s'appuie surtout sur l'« historique de changement », une entrée dérivée des satellites indiquant les pixels déjà déforestés et l'année associée, dont l'usage seul donne des métriques de précision comparables à celles des données satellitaires brutes complètes. Google Research publie en parallèle le premier benchmark public dédié à l'entraînement de modèles de prédiction du risque de déforestation, avec les données d'entrée, d'entraînement et d'évaluation.
OpenAI présente IndQA, un nouveau benchmark destiné à évaluer les systèmes d'IA dans les langues indiennes. Conçu avec des experts du domaine。
Google Research a présenté lors de son événement Research@MTV trois avancées : Earth AI。
Google Research présente provably private insights (PPI), un système qui combine LLM。
Motif de la recommandation :Présente un système combinant LLM, confidentialité différentielle et TEE pour analyser l'usage des outils GenAI sans exposer les données individuelles, avec code open source.
OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b。
Motif de la recommandation :Deux modèles ouverts de raisonnement dédiés au marquage de contenu selon une politique fournie, avec évaluations de sécurité comparées aux gpt-oss de base.
Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。
Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.
OpenAI et Retro Bio ont utilisé un modèle d'IA spécialisé, GPT-4b micro, pour concevoir des protéines plus efficaces destinées à la thérapie par cellules souches et à la recherche sur la longévité.
OpenAI a étudié les risques de frontière en pire cas liés à la publication de gpt-oss via une méthode de fine-tuning malveillant (MFT)。
OpenAI publie une analyse économique sur l'impact de ChatGPT et lance une nouvelle collaboration de recherche consacrée aux effets plus larges de l'IA sur le marché du travail et la productivité. L'analyse fournit des éclairages sur les retombées économiques de ChatGPT. La collaboration de recherche vise à étudier les effets de l'IA sur le marché du travail et la productivité.
OpenAI研究发现, 在错误回答上训练语言模型会导致更广泛的misalignment行为, 并识别出一个驱动该行为的内部特征, 通过极少量fine-tuning即可将其逆转. 该研究聚焦于错误训练数据引发misalignment泛化的机制, 为理解和预防此类问题提供了可操作的干预方向.
Mistral AI publie Codestral Embed, son premier modèle d'embedding dédié au code。
Motif de la recommandation :Mistral publie les performances comparées de Codestral Embed face à Voyage Code 3, Cohere Embed v4.0 et OpenAI, ainsi que les compromis dimension/précision et le tarif API.
OpenAI发布HealthBench, 一个面向医疗领域AI模型的评估基准, 用于在贴近真实的场景中评测模型表现. 该基准在250余名医生的参与下构建, 目标是提供模型在健康领域性能与安全性的统一标准.
OpenAI 发布 MLE-bench, 一个用于衡量 AI agent 在机器学习工程任务中表现的基准. 该基准的评估对象是 AI agent 的机器学习工程能力, 而非单纯的模型推理或编码能力.
OpenAI 在其 API 平台上线模型蒸馏功能, 开发者可用大型前沿模型的输出微调出高性价比的小模型. 该功能面向 API 用户, 旨在以更低成本获得接近前沿模型的性能表现.
OpenAI présente des techniques d'entraînement améliorées pour les Consistency Models。
OpenAI a identifié automatiquement 16 millions de motifs dans les calculs de GPT-4 en utilisant de nouvelles techniques de mise à l'échelle des autoencodeurs parcimonieux. Cette méthode permet d'extraire des concepts du modèle.
Mistral AI annonce la personnalisation de modèles sur la Plateforme, avec trois points d'entrée 。
Motif de la recommandation :Mistral ouvre trois voies de personnalisation, du SDK open source au fine-tuning serverless, ce qui permet de situer le coût et l'effort requis selon son infrastructure.
ChatGPT enrichit son analyse de données : il est désormais possible d'interagir directement avec les tableaux et les graphiques。
OpenAI 在 ChatGPT 发布一年多后阐述了其数据与 AI 方法, 并推出面向创作者和内容所有者的新工具 Media Manager. 该工具旨在回应 AI 时代关于数据使用的讨论, 同时 OpenAI 也说明了其后续发展方向.
OpenAI ajoute de nouvelles fonctionnalités à son API de fine-tuning pour donner aux développeurs davantage de contrôle。
OpenAI annonce de nouveaux modèles d'embedding et des mises à jour d'API.
Digital Green utilise OpenAI pour accroître les revenus des agriculteurs. L'organisation s'appuie sur l'IA d'OpenAI pour bâtir une base de données agricole destinée aux agriculteurs.
Hugging Face a retiré le benchmark DROP de l'Open LLM Leaderboard après avoir constaté que la majorité des modèles obtenaient un f1-score inférieur à 10 sur 100. L'enquête a révélé que la normalisation ignorait les réponses numériques suivies d'un espace autre qu'un espace simple, et que l'utilisation du point comme token d'arrêt interrompait les réponses à virgule flottante et pénalisait les modèles générant de longues réponses. Une réexécution complète coûtant 8 années de temps GPU, l'équipe a décidé de retirer DROP jusqu'à ce qu'une nouvelle version corrige le scoring et la normalisation.
OpenAI annonce des Data Partnerships visant à créer des datasets open source et privés pour l'entraînement de l'IA. L'initiative repose sur une collaboration avec des partenaires pour constituer ces jeux de données destinés à l'entraînement des modèles.
Explosion lance Prodigy-HF, un plugin qui intègre directement l'outil d'annotation Prodigy au stack Hugging Face. Il permet de fine-tuner tout modèle Transformer du Hub。
Renumics Spotlight permet de visualiser interactivement les datasets Hugging Face avec une seule ligne de code。
Hugging Face annonce que ses tokenizers disposent désormais d'un attribut chat_template。
Motif de la recommandation :L'article explique comment les chat templates stockent le format d'entraînement dans le tokenizer et évitent une dégradation silencieuse des performances.
Hugging Face a mis en ligne un Object Detection Leaderboard qui classe les modèles de détection d'objets disponibles sur le Hub selon plusieurs métriques. Le classement s'appuie sur l'IoU。
Hugging Face explique comment fine-tuner Llama 2 70B avec PyTorch FSDP sur 2 nœuds de 8 GPU A100 80GB。
Motif de la recommandation :Le guide détaille les trois obstacles du fine-tuning de Llama 2 70B sous FSDP et les solutions concrètes apportées par Transformers et Accelerate.
OpenAI s'associe à Scale pour permettre aux entreprises de fine-tuner ses modèles les plus avancés, les clients d'OpenAI pouvant s'appuyer sur l'expertise IA de Scale pour personnaliser ces modèles.
Hugging Face déploie Huggy Lingo, un système qui détecte automatiquement la langue des datasets du Hub dépourvus de métadonnées linguistiques et ouvre des pull requests via librarian-bots pour les ajouter. Le modèle fastText de Meta (facebook/fasttext-language-identification), issu des travaux No Language Left Behind, identifie 217 langues à partir de 20 lignes de texte récupérées via l'API dataset viewer. Environ 87 % des quelque 50 000 datasets publics ne précisent pas leur langue, contre 13 % qui le font, l'anglais représentant à lui seul près de 19 % des tags déclarés.
Segmind a mis en open source le code d'entraînement et les poids de ses modèles SD-Small et SD-Tiny。
Motif de la recommandation :L'article détaille la méthode de distillation par suppression de blocs et publie le code et les poids, ce qui permet de reproduire et d'adapter ces modèles compressés.
Viable exploite GPT-4 pour analyser des données qualitatives à une échelle révolutionnaire avec une précision inégalée. L'outil s'appuie sur le modèle d'OpenAI pour traiter de grands volumes de données qualitatives.