蚂蚁灵波发布空间感知模型 LingBot-Depth 2.0 及视觉基座 LingBot-Vision
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
智平方科技在联合国开源周展示全球首个原创类脑大模型 NeuroVLA 及一站式开源平台 AlphaBrain Platform,其海外与生态副总裁 Kristine Mo 与图灵奖得主杨立昆同台交流。NeuroVLA 借鉴人脑“皮层—小脑—脊髓”三层协同机制,以更少数据完成学习与决策,使机器人运动抖动降低 75% 以上,脊髓层平均功耗低至 0.4 瓦。
地瓜机器人发布世界模型 Uranus,定位为机器人开发基础设施,用于评测 VLA 与世界模型并支持操作训练仿真。它采用帧级闭环逐帧生成,训练时只见过 2 秒短片段,推理时可稳定运行 60 秒,支持 G1 人形机器人和 Franka 协作臂,目前仅支持 manipulation 训练,尚不支持 locomotion。
FaceMind脸谱心智提出 Ego-NeuroLoop 数据范式,同步采集 world camera、gaze、EEG、sEMG 四类信号,记录人类操作时"看哪里、准备做什么、肌肉怎么发力、反馈如何修正"的完整闭环。
英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。
推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。
Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。
NVIDIA 提出世界动作模型(WAM)概念,指从预训练世界模型或视频模型出发、再微调为机器人策略的一类模型,与从 VLM 骨干起步的 VLA 形成对照。文中以 Pi-0 和 GR00T N1 作为 VLA 的代表案例。
NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。
推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,可基于美国地点影像生成可交互世界,并支持“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格。
DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。
推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。
NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。
Hugging Face 的 LeRobot 发布 v0.4.3,新增 X-VLA 策略和基于 tokenization 的自回归 VLA PiFast,并加入 Unitree G1、OMX、Earth Rover Mini Plus 等机器人支持。
NVIDIA 发布 Isaac GR00T N1.6,用于构建人形机器人的通用能力,覆盖感知、规划与全身控制。该工作流将仿真、控制与学习统一起来,让机器人在进入真实世界前先习得复杂技能。
推荐理由:NVIDIA 官方给出 GR00T N1.6 的仿真到真实工作流,读者可了解人形机器人通用能力训练如何统一仿真、控制与学习。
NVIDIA 发布 Alpamayo,面向自动驾驶的推理式视觉语言动作(VLA)模型,可将决策过程展开为逐步推理轨迹。该模型被视为在语义空间中运行的隐式世界模型,用于处理复杂驾驶问题。
NVIDIA 在 GTC 2025 首次发布的 Cosmos Reason 是一个开放且可完全定制的推理视觉语言模型(VLM),面向物理 AI 与机器人,让机器人和视觉 AI 智能体借助先验知识、物理理解和常识进行推理,从而在真实世界中理解并行动。该模型已在 Hugging Face 的 Physical Reasoning 排行榜上登顶。