跳到正文
原文
arXiv cs.RO· Haoyu Wang, Siyuan Qian, Yanjun Li, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang·· 2 小时前精选AI 评分62

DexPolicy:面向轨迹引导灵巧操作的调度式探索方法

DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation

AI 导读

DexPolicy 提出把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索,在保持损失、架构、奖励和优化器设置不变的前提下研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。

推荐理由

论文把探索尺度显式设为训练步数的退火函数,并给出仿真与真机的成功率对比,可供做灵巧操作 RL 训练的人参考。

来源:arXiv cs.RO · arxiv.org