arXiv cs.RO· Jiaxuan Luo, Xingguo Xu, Shanshan Wang, Yuhan Zhou, Zhen Zhang·· 3 小时前精选AI 评分71
CriticHack:评估机器人策略优化中的视觉奖励
CriticHack: Evaluating Visual Rewards Under Robot Policy Optimization
AI 导读
arXiv 论文 CriticHack 研究视觉奖励模型在机器人策略优化中的失效问题。作者在抽屉任务上对扩散策略的全部去噪参数针对 Robometer 微调,五次训练在 512 个评估种子上把任务成功率提高 10.2 个百分点。
推荐理由
论文用 512 个评估种子量化了视觉奖励优化放大错误物体失败的现象,并给出可解释的倾斜模型。
来源:arXiv cs.RO · arxiv.org