跳到正文
原文
arXiv cs.RO· Dehao Huang, Jianbang Liu, Jianpan Gao, Chao Tang, Zilang Cen, Zedong Dan, Jiaheng Wang, Tingguang Li, Yue Wang, Hong Zhang·· 2 小时前精选AI 评分66

eRLT:通过动作相关 token 路由实现高效 VLA 强化学习

eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing

AI 导读

eRLT 通过路由冻结 VLA 中与任务动作相关的信息来构建状态表示,用学习到的路由 token 聚合多层视觉语言特征,再由轻量层路由器合成固定维度的 RL token,并先用专家示范初始化、再用在线交互的 critic 反馈微调。

推荐理由

论文提出在冻结 VLA 的 token 与层间路由动作相关信息,为提升在线强化学习样本效率提供了一种可迁移的状态表示方法。

来源:arXiv cs.RO · arxiv.org