L'IA dépasse les experts-comptables agréés en vitesse et en précision, mais ne peut pas encore clôturer les comptes sans supervision
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Hugging Face a lancé l'Open TTS Leaderboard, un classement qui évalue les modèles TTS open source et multilingues via des métriques objectives.
NVIDIA publie Kumo Tabular, un modèle de fondation open source pour la classification et la régression sur données tabulaires.
Motif de la recommandation :NVIDIA ouvre un modèle de fondation tabulaire pré-entraîné uniquement sur des données synthétiques, avec poids et bibliothèque d'inférence, ce qui permet de mesurer le passage des arbres boostés à l'apprentissage en contexte.
Le UK AI Security Institute (AISI) publie via l'infrastructure d'EvalEval des résultats d'évaluation vérifiés pour cinq benchmarks — HealthBench.
OpenAI publie des recommandations pour les évaluations tierces des systèmes d'IA de pointe。
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI 推出 GDPval, 一项新的评估, 用于衡量模型在 44 种职业中具有真实经济价值的任务上的表现.
Motif de la recommandation :OpenAI 公布 GDPval 评估, 覆盖 44 种职业的真实经济价值任务, 可用于对照模型在现实工作场景中的表现.
OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure si ces agents peuvent répliquer des travaux de recherche publiés, sans précision sur les modèles testés ni les scores obtenus.