L'IA dépasse les experts-comptables agréés en vitesse et en précision, mais ne peut pas encore clôturer les comptes sans supervision
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Hugging Face a lancé l'Open TTS Leaderboard, un classement qui évalue les modèles TTS open source et multilingues via des métriques objectives.
OpenAI présente GeneBench-Pro, un nouveau benchmark évaluant les performances de l'IA en génomique。
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI 推出 GDPval, 一项新的评估, 用于衡量模型在 44 种职业中具有真实经济价值的任务上的表现.
Motif de la recommandation :OpenAI 公布 GDPval 评估, 覆盖 44 种职业的真实经济价值任务, 可用于对照模型在现实工作场景中的表现.
OpenAI发布HealthBench, 一个面向医疗领域AI模型的评估基准, 用于在贴近真实的场景中评测模型表现. 该基准在250余名医生的参与下构建, 目标是提供模型在健康领域性能与安全性的统一标准.
OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure si ces agents peuvent répliquer des travaux de recherche publiés, sans précision sur les modèles testés ni les scores obtenus.
OpenAI 发布 SWE-Lancer 基准, 用于评估前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元.
OpenAI présente SimpleQA, un benchmark de factualité qui mesure la capacité des modèles de langage à répondre à des questions courtes et factuelles.