
Algoritmo de RL sin aprendizaje TD para tareas a largo plazo
Segun BAIR (Berkeley AI Research), un nuevo enfoque en aprendizaje por refuerzo (RL) desciende de una estrategia de "dividir y vencer", que evita depender de métodos basados en aprendizaje por diferencia temporal (TD). Este paradigma altern…


