热点事件持续更新
DexPolicy:轨迹引导灵巧操作的调度探索
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.RO 刊出 DexPolicy 相关报道,提出一种面向轨迹引导灵巧操作的调度式探索方法。该方法把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索。报道称,在保持损失、架构、奖励和优化器设置不变的前提下,研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。目前进展停留在该方法与实验设置的介绍层面。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
DexPolicy 提出探索尺度随训练步数退火的调度式探索方法,并对比三种策略优化设置。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.RO精选DexPolicy:面向轨迹引导灵巧操作的调度式探索方法
DexPolicy 提出把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索,在保持损失、架构、奖励和优化器设置不变的前提下研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。