逐际动力发布Oli全自主家务Demo并更新LimX COSA 0.5
逐际动力发布一段3分钟一镜到底的视频,展示全尺寸人形机器人Oli全自主完成收纳整理、搬箱、深弯腰拾物等长程家务任务,无后台人工远程介入。支撑其行动的是刚更新的人形大脑系统LimX COSA 0.5,首次完整展示S2认知层、S1技能层、S0运控层三层架构,其中S0底层为自研LimX WBT全身运动基础模型,约千万参数Transformer策略,控制频率1000Hz。
逐际动力发布一段3分钟一镜到底的视频,展示全尺寸人形机器人Oli全自主完成收纳整理、搬箱、深弯腰拾物等长程家务任务,无后台人工远程介入。支撑其行动的是刚更新的人形大脑系统LimX COSA 0.5,首次完整展示S2认知层、S1技能层、S0运控层三层架构,其中S0底层为自研LimX WBT全身运动基础模型,约千万参数Transformer策略,控制频率1000Hz。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。
NVIDIA 发文讨论通用机器人策略在真实世界部署前的评估难题,指出当前最强系统已能按自然语言指令完成抓取、放置、分拣和操作多种物体,但严格评估仍是该领域最难解决的未解问题之一。文章介绍了其中的关键问题及 NVIDIA 的应对方法。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
OpenRAL 发布开源机器人智能层(RAL),定位为物理 AI 的运行时框架,在 ROS 2、tf2、MoveIt 2、Nav2、ros2_control 之上用 Pydantic v2 schema 建立各层之间的类型化契约。
原力灵机在开发者大会上发布新一代具身基础模型DM0.5,参数规模4B较上一代DM0翻倍,数据量增加400%,由5万小时真机操作数据、10万小时第一视角数据和100万平方米场景重建数据构成。
曾推出 RoboTwin 系列的团队发布 RoboDojo,一个统一的仿真加真实世界机器人操作评测基准,包含 42 个仿真任务和 18 个真机任务,覆盖泛化、记忆、精细操作、长程执行和开放语义五类能力。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。
推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。
SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。
论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。
推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
智平方科技在联合国开源周展示全球首个原创类脑大模型 NeuroVLA 及一站式开源平台 AlphaBrain Platform,其海外与生态副总裁 Kristine Mo 与图灵奖得主杨立昆同台交流。NeuroVLA 借鉴人脑“皮层—小脑—脊髓”三层协同机制,以更少数据完成学习与决策,使机器人运动抖动降低 75% 以上,脊髓层平均功耗低至 0.4 瓦。
ROBOTIS 在 AI Worker 上发布基于行为树(BT)的全身 VLA 框架,将 GR00T N1.7 的 VLA 策略与确定性规则控制结合,用于处理复杂长程全身任务。
WAIC 2026 将聚焦世界模型路线之争,围绕 VLA 与世界模型的替代、并存、融合三种猜想展开讨论。论坛汇聚大晓机器人王晓刚、诺奖得主托马斯·萨金特及英伟达等代表,萨金特以开普勒式描述模型与牛顿式结构模型为行业路线定调。
Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。
NVIDIA 提出世界动作模型(WAM)概念,指从预训练世界模型或视频模型出发、再微调为机器人策略的一类模型,与从 VLM 骨干起步的 VLA 形成对照。文中以 Pi-0 和 GR00T N1 作为 VLA 的代表案例。
加州大学圣地亚哥分校计算机科学与工程教授 Henrik I. Christensen 发布了一份全球机器人技术路线图,聚焦亚洲、欧洲和美洲,梳理机器人技术现状与主要机会,覆盖 2025–2035 年。
NVIDIA 介绍用 Alpamayo 对自动驾驶车辆模型进行闭环后训练,以弥合训练与部署之间的差距。可推理复杂驾驶场景的 VLA 模型目前主要在开环下训练,模型输出直接与真值行为比较,不考虑其对环境的影响。
DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。
推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。
Hugging Face 的 LeRobot 发布 v0.4.3,新增 X-VLA 策略和基于 tokenization 的自回归 VLA PiFast,并加入 Unitree G1、OMX、Earth Rover Mini Plus 等机器人支持。
NVIDIA 发布 Alpamayo,面向自动驾驶的推理式视觉语言动作(VLA)模型,可将决策过程展开为逐步推理轨迹。该模型被视为在语义空间中运行的隐式世界模型,用于处理复杂驾驶问题。
NVIDIA 在 GTC 2025 首次发布的 Cosmos Reason 是一个开放且可完全定制的推理视觉语言模型(VLM),面向物理 AI 与机器人,让机器人和视觉 AI 智能体借助先验知识、物理理解和常识进行推理,从而在真实世界中理解并行动。该模型已在 Hugging Face 的 Physical Reasoning 排行榜上登顶。