Aller au contenu
OpenAI News·· 2024-10-10AI Score38

MLE-bench : évaluer les agents IA sur l'ingénierie du machine learning

MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

AI Introduction

OpenAI présente MLE-bench, un benchmark destiné à mesurer la performance des agents IA sur des tâches d'ingénierie du machine learning. Le benchmark vise à évaluer dans quelle mesure ces agents savent mener des travaux d'ingénierie ML, sans que le texte source précise de chiffres, de modèles ou de résultats associés.

Source :OpenAI News · openai.com