ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。
推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。
Google DeepMind 集中列出其模型阵容,包括新一代前沿智能 Gemini、实时音频模型 Gemini Audio、视频生成模型 Veo、图像生成与编辑模型 Nano Banana。
论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。
推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。
Hugging Face 论文页上线 Magpie,一个面向交互式游戏的实时世界渲染器。该页面目前仅开放论文讨论,未披露模型规模、渲染帧率或真机部署等细节。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。
论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。
推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。
超维动力在2026世界机器人大会现场展示全栈具身智能系统,包括全尺寸人形机器人KAI Bot、37自由度灵巧手KAI Hand、数采头环KAI Halo、KAI World Model与KAI Embodied AI Infra。
Google DeepMind 发布白皮书《Visual General Intelligence》,探讨以视觉为中心、从图像、视频和几何等模态的学习中能否涌现出通向 AGI 的智能,并将其称为视觉通用智能(VGI)。白皮书由多位不同机构作者共同撰写,目标不是给出视觉智能的唯一定义,而是厘清 AGI 时代计算机视觉应追求的原则、视觉输入模态、基准、学习范式,以及视觉作为核心与语言等其他模态的关系。
生数科技创始人朱军在 WRC 2026 分论坛发布团队最新研究成果,提出通用世界模型五级发展路线,从 L1 世界生成、L2 与世界交互、L3 在世界中行动,到 L4 自主世界智能体与 L5 世界组织者。
ResNet作者、蔚来高级副总裁及智驾负责人任少卿已成立物理AI基础模型和具身智能独立公司,蔚来明确战略投资并开展业务合作,公司已完成注册、估值达独角兽级别(超10亿美元量级),名称与融资细节未披露。任少卿仍在职蔚来,其技术底色来自蔚来世界模型NWM的研发与量产推送经验,他曾多次强调世界模型是自动驾驶与机器人共享的基础范式。
智象未来在 WRC 2026 发布原生全模态交互式世界模型 HiDream-O1-World,基于自研 UiT 架构,首次参评即登顶 WBench 的 Navi 分榜。该模型支持文本、图像及交互式操控输入,具备漫游、编辑、交互三项能力,核心突破是长时程时空一致性与物理一致性。
无界动力与韩国咖啡连锁 HOLLYS 在北京亦庄 WRC 现场开设联名咖啡店,由轮式半人形机器人服务员和机械臂咖啡师在开放人流中完成送餐、收杯、倒垃圾和手部消毒等连续任务,无预设轨迹。
无界动力在2026世界机器人大会上集中展示以隐空间世界模型为核心的具身通用大脑MWA™,并提出“隐空间世界模型+强化学习”技术路线。创始人张玉峰称世界模型价值在于推演行动如何改变世界,公司主张“用工业练技能、用商业练泛化”。CTO夏中谱认为具身智能仍处“诸子百家”早期阶段,产品解决方案总经理沈明达则提出工业产线自动化从G1到G5的五级进化。
知跃空间智能发布全脑仿真基础平台 DeepSoma(知跃灵物),从树突、膜电位、离子通道等生物物理层面建模精细神经元,而非 Eon Systems 采用的 LIF 简化模型。
优必选在2026年WRC上1:1复刻客户工厂产线,用近十台工业人形机器人Cruzr S2和Cruzr Y1连续演示汽车机加件与钣金件上下料、搬运拆码垛和物流小件分拣,定位精度小于1mm,平均抓取节拍最高接近1100件/小时。
8月21日世界机器人大会期间,星海图举办“从模型到生产力”技术与产业应用论坛,首席科学家赵行介绍G0.5基础模型内嵌原生动作思维链,并预告G0.5 MAX即将发布,同时启动G0.5复现计划,开放模型权重、推理接口、评测基准与微调工具。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。
推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。
千寻智能在2026世界机器人大会上重映了WAIC上做过的“整理客厅”长程任务Demo,并给出30天内的量化变化:可乐放入冰箱的自主推理成功率由约80%提升至99%以上,碗放入洗碗机由约90%提升至99%以上,导航目标确认耗时降低近50%,捡垃圾任务在颜色、种类、位置等泛化条件下执行成功率85%。
优必选在WRC 2026集中亮相工业人形机器人Cruzr Y1、商用服务人形机器人Walker C1和超仿生人形机器人U1,覆盖工业、商用、家庭消费三大场景。Cruzr Y1与Cruzr S2现场实景演示汽车钣金件上下料、料箱拆码垛等无人自主作业;U1搭载自研Resonance-LM情感大模型,具备33轴面部肌腱网络与19个主动自由度面肌。
Hugging Face 论文页发布 ForgeWM,一种面向少步动作条件视频世界模型的渐进式因果训练方法。该页面目前仅开放论文讨论,未披露模型规模、任务本体、成功率或推理时延等具体结果。
星尘智能在 WRC 首次亮相最新一代绳驱人形机器人 T1,起价 8.99 万元,并展示基座模型 Lumo-2、操作系统星尘 AOS 与绳驱本体三层全栈能力。团队一次性公开 22 项家庭任务真机测试,称 Lumo-2 在时序推理、物理理解、高精度、长时序与灵巧操作方面超过 Pi 0.5、FAST-WAM 等模型。
量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
章鱼动力(SynapX)在2026世界机器人大会发布“脑-手-数据”技术体系,包括SYNWorld具身原生世界基础模型、OctoH-Hand高自由度仿生灵巧手和OctoSense下一代具身数采方案。OctoSense称全球首次实现肌电跨个体零样本泛化,让人类操作数据近乎无损对齐真机。公司三个月内获近10亿元融资,投资方包括地平线、高瓴创投、小米战投等。
超维动力在2026世界机器人大会展出SMASH 2.0高动态人形乒乓系统、KAI世界模型、117个全身自由度的KAIBot、37个自由度的KAI Hand灵巧手与KAI Halo第一视角数采头环。
Current Robotics 团队发布交互式世界仿真器 CurrentWorld-0,把跨本体、多视角和力-触觉预测放进同一个系统,用于机器人策略评测。团队称模型保留不同本体的 Action Subspace,可同步生成多路视角,并让力觉与触觉随动作一起变化,避免世界模型替失败策略补回成功结果。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
理想智能驾驶前核心负责人郎咸朋与来自华为的任庚联手创办具身智能公司昆仑行,成立三个月内拿下数十亿人民币融资、跻身独角兽。郎咸朋称具身智能要解决的是“理解”而非模仿,昆仑行选择物理因果世界模型和“数据编译”路线,商业路径先从toB做起、家庭是终点。
自变量机器人进行「夹爪方案挑战1248件/小时物流分拣」公开直播实测,双机械臂加标准夹爪连续作业1小时,分拣效率达1816件/小时,准确率98%,全程无人工接管。
戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起的 TriWorldBench Challenge 公布首周榜单,这是首个面向机器人三视角世界模型的评测榜单。
元戎启行成立国内首个面向物理世界基础能力研究的 AI Lab——Superfluid Lab,由前 DeepSeek 核心成员、首席科学家阮翀带队,以基座模型为核心,重点探索 VLA 模型,同时推进世界模型和多模态理解。实验室今年 5 月已在内部成立,目前完成基础设施重构等早期工作,并同步启动大模型算法、仿真算法和 AI Infra 三个方向的招聘。
理想汽车前智驾一号位郎咸朋今年3月创立具身智能公司昆仑行,90天内连融三轮、规模达数十亿元,成为独角兽。他判断训一个具身大模型需几十亿甚至上百亿元,只靠融资撑不到具身实现那天,量产交付自我造血才是分水岭,行业最终会跑出自己的“蔚小理”。昆仑行选择先toB再toC,从工厂上下料、物流切入,家庭放到最后落地。
黎曼动力联合光轮智能和诺亦腾机器人共建具身智能数据底座,把采集、仿真、训练和评测接成一条线,并计划到2026年底完成100万小时机器人训练数据采集。黎曼动力此前用23.2万小时数据训练出Riemann-1.0,其前身为昆仑万维内部Matrix世界模型团队。三方还将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。
推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。