跳到正文
原文
arXiv cs.RO· Youngjun Jun, Kyumin Choi, Youngmin Kim, Seonghyun Jin, Sunwoo Park, Jangho Park, Jong Chul Ye·· 2 小时前精选AI 评分62

DriftOPD:面向一步 VLA 策略的序列级反向 KL 蒸馏

DriftOPD: Sequence-Level Reverse-KL Distillation for One-Step VLA Policies

AI 导读

DriftOPD 是一个免教师、免 rollout 的框架,用于对连续 VLA 动作专家做序列级 on-policy 蒸馏。作者将序列级反向 KL 散度分解为 chunk 级反向 KL 项与刻画当前动作长时程影响的未来势能项,分别用一步 drifting 目标和从离线示范学习的 Q 函数评论家优化,从而仅靠离线数据和一步动作生成实现序列级优化。

推荐理由

提出免教师、免 rollout 的序列级蒸馏框架,把长时程行为压进一步 VLA 策略,可了解离线数据下的训练思路。

来源:arXiv cs.RO · arxiv.org