跳到正文
原文
arXiv cs.RO· Mousumi Das, Aditeya Prajapati, Abrar Anwar, Jesse Thomason·· 2 小时前AI 评分58

SWAP:面向视觉语言动作模型的分步动作策略路由

SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models

AI 导读

SWAP 提出一种在任务执行过程中动态组合多个 VLA 策略的框架,把策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,使机器人能在执行中在线切换策略而非整段任务固定使用单一策略。

来源:arXiv cs.RO · arxiv.org