ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 上线论文《Quo Vadis, World Modeling?》的讨论页面,邀请社区就该论文参与讨论。原文未披露论文的具体方法、模型或实验数据。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
具身智能行业估值逻辑正从为 Demo 可能性付费转向为生产力付费,投资人开始追问机器人每天干几小时活、客户是否续约。上海交通大学杨学以酷哇科技首席科学家身份提出,世界模型分两层,第二层理解并遵守人类社会规则才是最大机会,验证场所只有真实部署现场。酷哇已积累 50PB 城市运行数据、万台级真机部署于全球 50+ 城市及地区,并自研通用具身大模型 COOWAM。
World Labs于7月21日宣布收购机器人仿真公司SceniX,一周后双方公布Real-to-Sim-to-Real(R2S2R)最新成果,将真实机器人任务搬进仿真、在放大的任务场景中训练和评测策略,再部署回真机,并检验仿真中的相对表现能否预测真机表现。
香港大学 Taku Komura 团队 2016 年发表的《A Deep Learning Framework for Character Motion Synthesis and Editing》获 SIGGRAPH 时间检验奖,该工作首次用深度学习从大规模动作捕捉数据中学习可复用的运动表示。
World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。
推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
超维动力与北大医疗达成合作,围绕具身智能在医疗场景中的数据采集、世界模型与仿真训练展开联合创新,构建从拟真训练到场景验证再到医院应用的落地路径。超维动力提供KAI World Model世界模型引擎、KAI Halo第一人称数据采集头环及KAI Embodied AI Infra等技术底座,北大医疗提供临床场景与医疗经验。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
上海新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,数据与模型均开源。
推荐理由:三份报告分别给出触觉数据底座、VLA 触觉预判和世界模型触觉预测,可对照看触觉如何接入现有技术路线。
RSS 2026 上,Physical Intelligence 相关研究者称包括 PI 在内的北美头部具身智能公司离成熟都还有不短距离,整个领域尚未出现奠基性工作,并质疑中国公司自称"中国版XX"。多位研究者认为 VLA 与世界模型并不冲突,π0.7 已含世界模型组件;数据筛选与配比(curation)比单纯堆量更关键,Simar Kareer 建议参照 π0 的 1 万小时训练规模。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
7月19日WAIC“世界模型六小龙”论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人六家技术负责人就技术路线展开讨论,形成像素生成、隐空间(JEPA)与融合三派。
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
量子位在 WAIC 2026 现场总结出十大趋势:Agent 成为约 70% 展商的默认话题,能否完成有效交付取代参数规模成为衡量大模型能力的标准。具身智能从动作演示转向真干活,灵初智能联合长飞切入光模块生产,方案搭载自研大模型 Psi-R2,初步测算可降低生产损耗率约 10%。未来不远机器人以 3000 元/月租赁价落地 500 多个家庭,开展首日 8 台被抢空。
日冕开物与广东远图未来科技启动超级工站战略合作,计划2027年完成百台级部署,未来实现万台级具身智能产品部署。WAIC 2026现场,其超级工站基于自研LaMPA世界模型,在通电后仅训练半小时即完成服务器制造场景的新环境适配。该方案由LaMPA物理世界模型、模块化机器人硬件和Workflow Agent组成,目标形成规划、测试、执行、反馈、进化的闭环。
酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。
Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。
国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
PyTorch 基金会执行董事柯理怀在 WAIC 论坛上宣布,蚂蚁集团、阿里云、Shopify 正式成为基金会新成员。蚂蚁灵波科技同期发布全栈 2.0 及核心模型 LingBot-VA 2.0,称其为行业首个"具身原生"世界动作模型,面向机器人真实任务从头预训练,可边行动边预测。基于该通用大脑打造的"机器人智慧药房"已入选 WAIC2026"十大镇馆之宝"。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
银河通用发布面向具身智能大模型的测试时后训练框架 WAM-TTT,将 Test-Time Training 迁移至机器人控制,无需重新预训练或人类动作标注,仅用未标注人类 RGB 视频即可在部署阶段适配新场景。
文远知行内部孵化的景烁科技独立运营,由文远001号员工霍达任CEO,不做整机也不做大脑,专注物理AI的数据与世界模型基础设施。其三层架构为WorldEngine数据闭环、GENESIS-Robotics世界模型和SkillForge技能包,后者已含500K+小时真实交互数据、200+标准化技能包。景烁还自研EGOK采集设备,双目4K@60fps、延迟8ms、整机280g。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
阿里巴巴旗下高德发布通用世界模型工坊ABot-World Studio并开放测试,可将文字或图片生成可实时交互的AI世界,输出为视频与3DGS文件。该工坊可在单张5090上本地部署,官方实测单次连续推理稳定运行超1小时且无质量衰减,并内置“时空任意门”实现3D世界间跃迁。底层ABot-World0与ABot-3DWorld0模型已全面开源,官网、GitHub及Hugging Face同步上线。
推荐理由:高德把交互式视频与3DGS场景生成统一进一个工坊,并开源模型,读者可据此了解世界模型的一条新路径。
中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。
搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。
推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。
论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。
推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。