DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
优艾智合研发的FabriVLA在Evo-SOTA榜单的Meta-World MT50基准中以90.0%的tier-average成功率登顶第一,超过包括π0在内的国际模型,参数规模为1B级。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
魔法原子在 2026 世界人工智能大会(WAIC)期间展示自研通用具身大模型 Magic-VLA K02,现场完成叠盒封胶、柔性衣物整理和行李箱收纳等长程任务,其中叠盒封胶组合式长程任务成功率超过 90%。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
阿里巴巴旗下高德发布通用世界模型工坊ABot-World Studio并开放测试,可将文字或图片生成可实时交互的AI世界,输出为视频与3DGS文件。该工坊可在单张5090上本地部署,官方实测单次连续推理稳定运行超1小时且无质量衰减,并内置“时空任意门”实现3D世界间跃迁。底层ABot-World0与ABot-3DWorld0模型已全面开源,官网、GitHub及Hugging Face同步上线。
推荐理由:高德把交互式视频与3DGS场景生成统一进一个工坊,并开源模型,读者可据此了解世界模型的一条新路径。
搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
原力灵机在开发者大会上发布新一代具身基础模型DM0.5,参数规模4B较上一代DM0翻倍,数据量增加400%,由5万小时真机操作数据、10万小时第一视角数据和100万平方米场景重建数据构成。
蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。
7月9日,蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0(又称LingBot-World-Infinity),支持小时级实时生成、720p/60fps高清实时输出,并首次将Agent机制引入世界模型。
7月9日,蚂蚁灵波开源LingBot-Video,称其为全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型采用DiT+MoE设计,30B总参数生成时仅激活约3B参数,相比同等规模Dense架构约有3倍推理效率,并引入VLA、VLN、Ego等共7万小时具身数据。
魔芯科技联合浙江大学潘云鹤院士、华为等发布实时交互世界模型 MoWorld,全栈基于国产 NPU,14B 参数 MoE 模型实现最高 50FPS 推理,推理成本为同规模 GPU 方案的 30%。
蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。
推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
蚂蚁灵波开源空间原生视觉基模 LingBot-Vision,并发布基于它的空间感知模型 LingBot-Depth 2.0。
7月7日,蚂蚁集团旗下灵波科技发布空间感知模型 LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模,在深度补全基准16项测评中获12项第一,室内大面积深度缺失场景RMSE从0.132降至0.062。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
智平方科技在联合国开源周展示全球首个原创类脑大模型 NeuroVLA 及一站式开源平台 AlphaBrain Platform,其海外与生态副总裁 Kristine Mo 与图灵奖得主杨立昆同台交流。NeuroVLA 借鉴人脑“皮层—小脑—脊髓”三层协同机制,以更少数据完成学习与决策,使机器人运动抖动降低 75% 以上,脊髓层平均功耗低至 0.4 瓦。
地瓜机器人发布世界模型 Uranus,定位为机器人开发基础设施,用于评测 VLA 与世界模型并支持操作训练仿真。它采用帧级闭环逐帧生成,训练时只见过 2 秒短片段,推理时可稳定运行 60 秒,支持 G1 人形机器人和 Franka 协作臂,目前仅支持 manipulation 训练,尚不支持 locomotion。
FaceMind脸谱心智提出 Ego-NeuroLoop 数据范式,同步采集 world camera、gaze、EEG、sEMG 四类信号,记录人类操作时"看哪里、准备做什么、肌肉怎么发力、反馈如何修正"的完整闭环。
英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。
推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。
Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。
NVIDIA 提出世界动作模型(WAM)概念,指从预训练世界模型或视频模型出发、再微调为机器人策略的一类模型,与从 VLM 骨干起步的 VLA 形成对照。文中以 Pi-0 和 GR00T N1 作为 VLA 的代表案例。
NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。
推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,可基于美国地点影像生成可交互世界,并支持“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格。
DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。
推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。
NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。