跳到正文
原文
BAIR·· 2025-11-01精选AI 评分60

不依赖 TD 学习的强化学习:Transitive RL 的分治价值学习

RL without TD learning

AI 导读

BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。

推荐理由

作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。

来源:BAIR · bair.berkeley.edu