arXiv cs.RO· Haoyu Wang, Siyuan Qian, Yanjun Li, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang·· 2 小时前精选AI 评分62
DexPolicy:面向轨迹引导灵巧操作的调度式探索方法
DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
AI 导读
DexPolicy 提出把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索,在保持损失、架构、奖励和优化器设置不变的前提下研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。
推荐理由
论文把探索尺度显式设为训练步数的退火函数,并给出仿真与真机的成功率对比,可供做灵巧操作 RL 训练的人参考。
来源:arXiv cs.RO · arxiv.org