arXiv cs.RO· Ryan Li, Yigit Korkmaz, Erdem B{\i}y{\i}k·· 20 小时前精选AI 评分62
Reward-DAgger:基于通用进度奖励模型的机器人门控交互式模仿学习
Reward-DAgger: Robot-Gated Interactive Imitation Learning with General-Purpose Progress-Based Reward Models
AI 导读
Reward-DAgger 是一个机器人门控交互式模仿学习框架,利用通用奖励模型的密集进度信号判断何时需要人工干预。该方法不依赖策略内部结构,无需针对任务重新调参门控机制,在八项仿真与真实任务中持续提升下游策略的自主成功率,并在多数设置下优于运行时监控基线。代码与视频已公开。
推荐理由
提出用通用奖励模型的密集进度信号做机器人门控,读者可了解跨任务免调参的干预时机判定思路。
来源:arXiv cs.RO · arxiv.org