Aller au contenu
Berkeley AI Research·· 2025-11-01AI Score30

RL sans TD learning : l'apprentissage par division pour les tâches à long horizon

RL without TD learning

AI Introduction

Un algorithme de RL off-policy fondé sur le paradigme « diviser pour régner » remplace le TD learning en réduisant logarithmiquement le nombre de récursions de Bellman.

Source :Berkeley AI Research · bair.berkeley.edu