跳到正文
热点事件持续更新

DexPolicy:轨迹引导灵巧操作的调度探索

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.RO 刊出 DexPolicy 相关报道,提出一种面向轨迹引导灵巧操作的调度式探索方法。该方法把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索。报道称,在保持损失、架构、奖励和优化器设置不变的前提下,研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。目前进展停留在该方法与实验设置的介绍层面。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.RO精选
    DexPolicy:面向轨迹引导灵巧操作的调度式探索方法

    DexPolicy 提出把强化学习的探索尺度显式设为训练步数的函数,从宽探索逐步退火到窄探索,在保持损失、架构、奖励和优化器设置不变的前提下研究 PPO、无 critic 的 GRPO 续训和流参数化 PPO(FPO)三种策略优化设置。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。