arXiv cs.RO· Arunabh Bora·· 3 小时前AI 评分41
超越奖励黑客:四层人形机器人学习流水线中的代理指标偏离
Beyond Reward Hacking: Proxy Divergence Across Four Layers of a Staged Humanoid Learning Pipeline
AI 导读
一项研究指出,腿足机器人强化学习流水线中的奖励、课程门控、评估统计与参考动作四层均为代理指标,各自存在特征性偏离机制并可通过重构消除。作者用单个笔记本 GPU 上 13500 次迭代、四阶段成长的 1.91 米仿真人形 PPO 策略验证:基于平均误差的课程门控在技能缺失时仍按速率上限推进,同步重置的批量推力测试因步态相位混叠将 0.5 m/s 推力判为比 2.0 m/s 更危险。
来源:arXiv cs.RO · arxiv.org