跳到正文
原文
arXiv cs.RO· Yangang Zou, Jiajun Lu, Weitao Zhou, Haibao Yu, Bozhou Zhang, Jiawei Wang, Honglong Tian, Minglei Li, Li Zhang·· 6 小时前精选AI 评分62

PRICE:面向具身强化学习的物理关系信用分配方法

PRICE the Action Chunks: Physical Relational Credit Assignment for Embodied Reinforcement Learning

AI 导读

PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。

推荐理由

提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。

来源:arXiv cs.RO · arxiv.org