跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分38

无需TD学习的强化学习:分治范式如何扩展至长时程任务

RL without TD learning

AI 导读

该文提出一种基于分治范式的强化学习算法,替代传统时序差分(TD)学习,可将贝尔曼递归次数从线性降至对数级,避免误差累积,适用于长时程任务。研究在目标条件强化学习中首次实现该方法的规模化应用,无需调节n步TD的超参数,且不引入高方差或次优性。

来源:Berkeley AI Research · bair.berkeley.edu