Berkeley AI Research·· 2025-11-01AI 评分34
无需 TD 学习的强化学习:用分治法扩展 off-policy RL
RL without TD learning
AI 导读
一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹一分为二并组合子段价值来更新,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件 RL 这类高复杂度任务,且无需像 n-step TD 那样调节 n 超参数。目前该方法仍面临如何选取最优子目标 w 的难题。
来源:Berkeley AI Research · bair.berkeley.edu