Berkeley AI Research·· 2025-11-01AI Score30
RL sans TD learning : l'apprentissage par division pour les tâches à long horizon
RL without TD learning
AI Introduction
Un algorithme de RL off-policy fondé sur le paradigme « diviser pour régner » remplace le TD learning en réduisant logarithmiquement le nombre de récursions de Bellman.
Source :Berkeley AI Research · bair.berkeley.edu