Qwen 发布通用视觉-语言-动作模型 Qwen-VLA
Qwen 团队发布通用视觉-语言-动作模型 Qwen-VLA,基于 Qwen 多模态骨干模型,将机器人操作与视觉语言导航统一为同一动作或轨迹预测问题,经 T2A、CPT、SFT、RL 四阶段训练产出 Qwen-VLA-Instruct。
推荐理由:Qwen-VLA 把操作与导航统一进一个策略模型,并给出四阶段训练流程与多基准对比数据,可据此判断通用 VLA 与专项模型的差距。
追踪感知与导航的研究、可复用工程方法与真实部署证据。
Qwen 团队发布通用视觉-语言-动作模型 Qwen-VLA,基于 Qwen 多模态骨干模型,将机器人操作与视觉语言导航统一为同一动作或轨迹预测问题,经 T2A、CPT、SFT、RL 四阶段训练产出 Qwen-VLA-Instruct。
推荐理由:Qwen-VLA 把操作与导航统一进一个策略模型,并给出四阶段训练流程与多基准对比数据,可据此判断通用 VLA 与专项模型的差距。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
Figure 发布 Project Go-Big,为 Helix 视觉语言动作模型构建互联网规模的人形机器人预训练数据集,并与 Brookfield 合作,后者拥有全球超 10 万套住宅单元、5 亿平方英尺商业办公空间和 1.6 亿平方英尺物流空间。
推荐理由:Figure 公布 Helix 仅用人类第一视角视频训练即可完成真实家居导航,并披露与 Brookfield 的数据采集合作规模。
银河通用机器人发布产品级端到端导航大模型TrackVLA,官方称其面向让机器人在真实街道环境中自主行走的应用场景。
Apptronik 发布人形机器人 Apollo,身高约 5 英尺 8 英寸、重 160 磅,可举升 55 磅,采用力控架构以保障与人协作时的安全。Apollo 支持双足行走、轮式躯干或固定安装三种模块化形态,配备可更换电池,单块续航四小时,近期面向仓储与制造场景的箱体与周转箱搬运。Apptronik 称其团队近十年间已建造超过 10 款机器人,包括参与 NASA Valkyrie 的开发。
推荐理由:Apollo 的尺寸、负载、模块化形态与可换电池设计,为判断人形机器人进入仓储制造场景的工程取舍提供了具体参照。