OpenAI améliore le raisonnement mathématique par la supervision du processus
Improving mathematical reasoning with process supervision
OpenAI indique avoir entraîné un modèle qui atteint un nouvel état de l'art en résolution de problèmes mathématiques en récompensant chaque étape de raisonnement correcte (supervision du processus) plutôt qu'en récompensant simplement la réponse finale correcte (supervision du résultat). Outre l'amélioration des performances par rapport à la supervision du résultat, la supervision du processus présente un avantage d'alignement : elle entraîne directement le modèle à produire une chaîne de pensée validée par des humains.
L'article expose la différence entre supervision du processus et supervision du résultat, ainsi que l'avantage d'alignement qui en découle, ce qui permet de comprendre une voie d'entraînement du raisonnement.
Source :OpenAI News · openai.com