OpenAI News·· 2024-10-10AI Score38
MLE-bench : évaluer les agents IA sur l'ingénierie du machine learning
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering
AI Introduction
OpenAI présente MLE-bench, un benchmark destiné à mesurer la performance des agents IA sur des tâches d'ingénierie du machine learning. Le benchmark vise à évaluer dans quelle mesure ces agents savent mener des travaux d'ingénierie ML, sans que le texte source précise de chiffres, de modèles ou de résultats associés.
Source :OpenAI News · openai.com