RL sans TD learning : l'apprentissage par division pour les tâches à long horizon
Un algorithme de RL off-policy fondé sur le paradigme « diviser pour régner » remplace le TD learning en réduisant logarithmiquement le nombre de récursions de Bellman.