跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分50

BAIR 介绍分治式价值学习算法 Transitive RL

RL without TD learning

AI 导读

BAIR 发文介绍一种不依赖 TD 学习的强化学习算法 Transitive RL(TRL),它把轨迹切成等长两段并组合两段价值来更新整条轨迹的价值,使 Bellman 递归次数对数级减少,且无需像 TD-n 那样调超参数 n。

来源:Berkeley AI Research · bair.berkeley.edu