跳到正文
原文
arXiv cs.RO· Eren Sadikoglu, Aditya Taparia, Xinyuan Liu, Ransalu Senanayake·· 20 小时前精选AI 评分62

ROOT:从可观测树中发现用户指定具身行为的奖励函数

ROOT: Discovering Rewards for User-Specified Embodied Behaviors

AI 导读

ROOT 是一个通过可观测树搜索发现奖励函数的框架,用于让强化学习策略对齐用户指定的具身行为,而非仅依赖标量训练统计。它把奖励设计建模为对持久实验树的观察引导搜索,树中存储奖励程序、训练策略、rollout 观测以及视频语言模型提炼的行为洞察,以诊断行为失败并指导后续奖励改进。

推荐理由

提出用视频语言模型诊断行为失败并迭代奖励函数的方法,在仿真与真机宇树 Go2 上验证。

来源:arXiv cs.RO · arxiv.org