arXiv cs.RO· Dehao Huang, Jianbang Liu, Jianpan Gao, Chao Tang, Zilang Cen, Zedong Dan, Jiaheng Wang, Tingguang Li, Yue Wang, Hong Zhang·· 2 小时前精选AI 评分66
eRLT:通过动作相关 token 路由实现高效 VLA 强化学习
eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing
AI 导读
eRLT 通过路由冻结 VLA 中与任务动作相关的信息来构建状态表示,用学习到的路由 token 聚合多层视觉语言特征,再由轻量层路由器合成固定维度的 RL token,并先用专家示范初始化、再用在线交互的 critic 反馈微调。
推荐理由
论文提出在冻结 VLA 的 token 与层间路由动作相关信息,为提升在线强化学习样本效率提供了一种可迁移的状态表示方法。
来源:arXiv cs.RO · arxiv.org