跳到正文
原文
阿里 Qwen 官方研究博客· QwenTeam·· 2026-05-29精选AI 评分88

Qwen 发布通用视觉-语言-动作模型 Qwen-VLA

Qwen-VLA:从看懂世界走向执行动作

AI 导读

Qwen 团队发布通用视觉-语言-动作模型 Qwen-VLA,基于 Qwen 多模态骨干模型,将机器人操作与视觉语言导航统一为同一动作或轨迹预测问题,经 T2A、CPT、SFT、RL 四阶段训练产出 Qwen-VLA-Instruct。

推荐理由

Qwen-VLA 把操作与导航统一进一个策略模型,并给出四阶段训练流程与多基准对比数据,可据此判断通用 VLA 与专项模型的差距。

来源:阿里 Qwen 官方研究博客 · qwen.ai