从海拉鲁到现实世界:视频模型如何理解「变化」
雷峰网用三组原创图生视频任务对比 HiDream-O1-Video-1.0、Seedance 2.5 与 MiniMax H3,考察意图规划、时间因果和音画对应。
雷峰网用三组原创图生视频任务对比 HiDream-O1-Video-1.0、Seedance 2.5 与 MiniMax H3,考察意图规划、时间因果和音画对应。
EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。
推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。
9月26日,杭州美梦空间在第五届全球数字贸易博览会上发布Physical-WAM物理-世界动作模型与RoboTwin-Phys物理漂移评测基准。Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,在感知输入与动作输出之间插入物理Token表征,用于估计摩擦、重量、重心、接触状态等物理信息并预判动作后果。
成立三个月的Simate发布首版通用物理快系统Simate-beta,据公司披露以平均Score 33.95、SR 27.96%登顶更新于2026年9月23日的RoboDojo榜单,该成绩属榜单评测,真机表现另行展示。
诺因(Knowin)9月24日发布面向通用具身智能的生成式学习架构 GLOW 技术报告,称人类演示一次后机器人即可跨物体、跨环境、跨任务复用,在开盒收纳、浇水、擦桌、调酒等任务中得到验证。
智象未来(HiDream.ai)发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本、图片、视频等多模态输入,可一键直出 5–20 秒 1080p 视频。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
9月10日,阿里巴巴集团旗下高德发布3D原生城市世界模型ABot-Earth 0.7,支持从星球到街景的一体化全尺寸AI生成,覆盖超过196个国家和地区。模型输入一张卫星图像或一段文字描述,可在消费级GPU上用10分钟生成公里级3DGS城市场景,效率比传统模式提升1000倍。体验官网已上线,相关能力已应用于飞行街景2.0,用户可操控摇杆漫游3D场景。
蚂蚁灵波发布LingBot-World 2.0轻量版,参数规模1.3B,面向消费级单卡GPU设计,可在本地实现实时世界生成。该版本延续7月开源的14B主模型路线,先训练Causal World因果预训练底座,再经一致性蒸馏与DMD蒸馏压缩去噪步数,并让Student在自身长时self-rollout轨迹上训练以减少累计漂移。
脸谱心智于 2026 年 6 月发布技术报告《Looped World Models》(arXiv: 2606.18208),提出 LoopWM,称其为首个将循环 Transformer 架构用于世界建模的方法,论文登上 Hugging Face Papers 当日 Top 1。
Scalabot 发布首个世界模型 HERON-World Model,输入当前画面和待执行动作即可预测后续画面,并支持多智能体动作配合与相互影响的预测。
智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,强化机器人物理感知与动态预判能力,打通图像、视频、3D、动作等模态。该模型首次参评具身智能仿真评测平台RoboColiseum,在扰动适应(Robustness)子榜以平均分0.692登顶榜首。
World Labs于9月2日发布多模态世界模型Atlas,可将文字、图像、视频和3D信息放入统一空间上下文,实现三维场景重建与新视角生成。国内团队影溯早在今年3月已开源具备类似能力的InSpatio-World,其升级版本即将发布并继续开源。
神秘具身团队放出代号“MVP”(Make Veritable People)的自进化模型系列 Demo,展示机器人在木棍推搡下端水不洒并同时扶住易拉罐、zero-shot 完成客厅收纳(团队称成功率 80%)、两台不同型号机器人跨本体协作抖床单,以及一次收纳 4 件物品的长程任务。团队称训练全部来自人类视频,并计划让机器人进入开放环境上街展示。
李飞飞 World Labs 发布多模态世界模型 Atlas,称其可仅凭一张图片生成像素级相机控制的图像和视频,最高输出 1 分钟、1440p 视频,并基于一张到数十张输入图像重建真实场景、输出显式 3D 表示。
推荐理由:Atlas 把相机控制生成、3D 重建与 Real-to-Sim 串成一条路径,可据此判断世界模型在机器人训练数据上的落点。
Google DeepMind 集中列出其模型阵容,包括新一代前沿智能 Gemini、实时音频模型 Gemini Audio、视频生成模型 Veo、图像生成与编辑模型 Nano Banana。
生数科技创始人朱军在 WRC 2026 分论坛发布团队最新研究成果,提出通用世界模型五级发展路线,从 L1 世界生成、L2 与世界交互、L3 在世界中行动,到 L4 自主世界智能体与 L5 世界组织者。
智象未来在 WRC 2026 发布原生全模态交互式世界模型 HiDream-O1-World,基于自研 UiT 架构,首次参评即登顶 WBench 的 Navi 分榜。该模型支持文本、图像及交互式操控输入,具备漫游、编辑、交互三项能力,核心突破是长时程时空一致性与物理一致性。
知跃空间智能发布全脑仿真基础平台 DeepSoma(知跃灵物),从树突、膜电位、离子通道等生物物理层面建模精细神经元,而非 Eon Systems 采用的 LIF 简化模型。
量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
Current Robotics 团队发布交互式世界仿真器 CurrentWorld-0,把跨本体、多视角和力-触觉预测放进同一个系统,用于机器人策略评测。团队称模型保留不同本体的 Action Subspace,可同步生成多路视角,并让力觉与触觉随动作一起变化,避免世界模型替失败策略补回成功结果。
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究员发布实时可交互音视频世界模型 HelixWorld 1.0,支持 24 FPS 实时生成画面并同时输出 48kHz 双声道音频,画面与声音由原生 Transformer 架构统一生成。
自变量机器人进行「夹爪方案挑战1248件/小时物流分拣」公开直播实测,双机械臂加标准夹爪连续作业1小时,分拣效率达1816件/小时,准确率98%,全程无人工接管。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。
推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。
国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
银河通用发布面向具身智能大模型的测试时后训练框架 WAM-TTT,将 Test-Time Training 迁移至机器人控制,无需重新预训练或人类动作标注,仅用未标注人类 RGB 视频即可在部署阶段适配新场景。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。