跳到正文
热点事件持续更新

DriftOPD:一步VLA策略的序列级蒸馏

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.RO 发布 DriftOPD,一个面向一步 VLA 策略的序列级蒸馏框架。该工作提出免教师、免 rollout 的方法,对连续 VLA 动作专家做序列级 on-policy 蒸馏:将序列级反向 KL 散度分解为 chunk 级反向 KL 项与刻画当前动作长时程影响的未来势能项,前者用一步 drifting 目标优化,后者用从离线示范学习的 Q 函数评论家优化,从而仅靠离线数据和一步动作生成实现序列级优化。目前报道仅此一篇,尚无后续进展或不同说法。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.RO精选
    DriftOPD:面向一步 VLA 策略的序列级反向 KL 蒸馏

    DriftOPD 是一个免教师、免 rollout 的框架,用于对连续 VLA 动作专家做序列级 on-policy 蒸馏。作者将序列级反向 KL 散度分解为 chunk 级反向 KL 项与刻画当前动作长时程影响的未来势能项,分别用一步 drifting 目标和从离线示范学习的 Q 函数评论家优化,从而仅靠离线数据和一步动作生成实现序列级优化。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。