蚂蚁灵波开源世界模型LingBot-World 2.0,支持小时级实时生成与AI原生多人交互
7月9日,蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0(又称LingBot-World-Infinity),支持小时级实时生成、720p/60fps高清实时输出,并首次将Agent机制引入世界模型。
7月9日,蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0(又称LingBot-World-Infinity),支持小时级实时生成、720p/60fps高清实时输出,并首次将Agent机制引入世界模型。
7月9日,蚂蚁灵波开源LingBot-Video,称其为全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型采用DiT+MoE设计,30B总参数生成时仅激活约3B参数,相比同等规模Dense架构约有3倍推理效率,并引入VLA、VLN、Ego等共7万小时具身数据。
量化派近期在餐饮后厨完成四轮具身智能技术验证,覆盖三明治柔性制作、购物袋自主分拣、牛排跨抽屉找盐调味和奶茶跨设备协同,均落地真实动态工况。其定位为跨场景、跨本体的开放生活场景世界模型提供商,不绑定硬件,主张让机器人从「动作自动化」迈向「任务级自主作业」,并以RaaS按效用付费模式切入。
General Intuition 上月以 23 亿美元估值融资 3.2 亿美元,其 CEO Pim de Witte 认为具身 AI 会像大语言模型一样走向通用基础模型,而非为每个本体和环境单独采集海量真实数据。
魔芯科技联合浙江大学潘云鹤院士、华为等发布实时交互世界模型 MoWorld,全栈基于国产 NPU,14B 参数 MoE 模型实现最高 50FPS 推理,推理成本为同规模 GPU 方案的 30%。
智源研究院悟界·RoboBrain Orca Team发布技术报告Orca: The World is in Your Mind,提出Next-State Prediction路线,先学习统一的世界状态表征,再从中读出理解、预测与行动能力。
ACID 提出在世界模型决策时规划中加入循环动作一致性代价:用逆动力学模型推断每个预测状态转移背后的动作,其与条件动作的偏差作为逐步规划代价。该方法在四个世界模型和六个任务上改善了规划效果,并显著减少了计算量。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
WAIC 2026 将聚焦世界模型路线之争,围绕 VLA 与世界模型的替代、并存、融合三种猜想展开讨论。论坛汇聚大晓机器人王晓刚、诺奖得主托马斯·萨金特及英伟达等代表,萨金特以开普勒式描述模型与牛顿式结构模型为行业路线定调。
纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。
地瓜机器人发布世界模型 Uranus,定位为机器人开发基础设施,用于评测 VLA 与世界模型并支持操作训练仿真。它采用帧级闭环逐帧生成,训练时只见过 2 秒短片段,推理时可稳定运行 60 秒,支持 G1 人形机器人和 Franka 协作臂,目前仅支持 manipulation 训练,尚不支持 locomotion。
FaceMind脸谱心智提出 Ego-NeuroLoop 数据范式,同步采集 world camera、gaze、EEG、sEMG 四类信号,记录人类操作时"看哪里、准备做什么、肌肉怎么发力、反馈如何修正"的完整闭环。
Aether AI 宣布完成 2000 万美元种子轮融资,由经纬创投领投,走不做视频生成、3D 重建和 JEPA 的因果世界模型路线。其内部数据显示,在机器人操作任务上,因果世界模型相比传统世界模型成功率提升 25%-50%,样本效率提升 5 到 10 倍,部分案例仅用 50 条高质量数据即可让频繁失败的任务达到可靠成功率。
脸谱心智(FaceMind Research Asia)的 Looped World Models(LoopWM)论文登上 Hugging Face Papers 当日 Top1,该工作让共享参数的 Transformer 模块对潜空间状态反复迭代细化,而非一次前向传播完成预测。
自变量连续完成B+、B++和C轮融资,投后估值突破200亿元并完成资本交割,成为大湾区首家估值超200亿元的具身大脑公司。已确认投资机构超30家,小米战投连续参与B、B+、B++三轮,美团、阿里、字节此前分别领投A、A+、A++轮。
NVIDIA 提出世界动作模型(WAM)概念,指从预训练世界模型或视频模型出发、再微调为机器人策略的一类模型,与从 VLM 骨干起步的 VLA 形成对照。文中以 Pi-0 和 GR00T N1 作为 VLA 的代表案例。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。
推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,可基于美国地点影像生成可交互世界,并支持“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格。
BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。
推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。
NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。
NVIDIA 发布 Alpamayo,面向自动驾驶的推理式视觉语言动作(VLA)模型,可将决策过程展开为逐步推理轨迹。该模型被视为在语义空间中运行的隐式世界模型,用于处理复杂驾驶问题。
NVIDIA 将开源机器人参考框架 Isaac Sim 与 World Labs 的生成模型 Marble 结合,可从文本提示直接生成照片级、可直接用于仿真的 3D 世界,替代以往需数周手工建模的流程。该方案面向机器人仿真环境构建,原文未披露具体版本号、成功率或性能数据。
NVIDIA 发布 Cosmos Cookbook,介绍如何用 Cosmos 开放世界基础模型(WFM)为物理 AI 扩展高保真合成数据生成。该方案针对真实世界数据集采集成本高、耗时长且危险的问题,支持可扩展的合成数据生成与数据增强。
NVIDIA 在 SIGGRAPH 宣布更新 Omniverse 库和 Cosmos 世界基础模型,基于 OpenUSD 为开发者提供新的库、模型和开发工具,用于构建物理精确的虚拟环境及理解真实世界的 AI 智能体。开发者还可通过 NVIDIA Cosmos Cookbook 获取分步工作流与技术配方。
NVIDIA Research 发布 R²D²,提出用世界基础模型(WFM)与配套工作流提升机器人训练。WFM 是经过训练、可基于真实环境动态模拟、预测并推理未来世界状态的生成式 AI 模型,用于应对物理 AI 系统对丰富标注数据日益增长的需求。文中提到 NVIDIA Cosmos 是相关平台。