arXiv cs.RO· Yuto Tanaka, Kyo Kutsuzawa, Martina Doku, Dai Owaki, Mitsuhiro Hayashibe·· 7 小时前精选AI 评分60
SynIL:利用运动协同度从不完美示范数据集中做离线模仿学习
SynIL: Leveraging Synergy for Offline Imitation Learning from Imperfect Demonstration Datasets
AI 导读
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由
提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
来源:arXiv cs.RO · arxiv.org