arXiv cs.RO· Mousumi Das, Aditeya Prajapati, Abrar Anwar, Jesse Thomason·· 2 小时前AI 评分58
SWAP:面向视觉语言动作模型的分步动作策略路由
SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models
AI 导读
SWAP 提出一种在任务执行过程中动态组合多个 VLA 策略的框架,把策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,使机器人能在执行中在线切换策略而非整段任务固定使用单一策略。
来源:arXiv cs.RO · arxiv.org