跳到正文

#世界模型

今日 2 条
9月2日周三
  1. HF blog74

    ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型

    ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。

    推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。

  2. HF blog62

    H3-World:把语言理解变成世界控制,将 33B MiniMax-H3 视频生成器改造为交互式世界模型

    H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。

    推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。

9月1日周二
8月31日周一
  1. HF blog62

    Code-as-World:用可执行代码表示物理世界,为视觉语言模型提供物理推理监督

    论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。

    推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。

8月29日周六
8月28日周五
  1. HF blog24

    Agentic Game Development 作为可验证轨迹数据引擎:为世界模型扩展提供数据

    论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。

  2. HF blog48

    GameWAM:面向视频游戏的世界动作模型

    Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。

  3. HF blog62

    PAWBench:当前视频生成模型距离概率对齐的世界模型还有多远

    论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。

    推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。

8月26日周三
  1. DeepMind blog27

    DeepMind 发布《视觉通用智能》白皮书:视觉经验能否通向 AGI

    Google DeepMind 发布白皮书《Visual General Intelligence》,探讨以视觉为中心、从图像、视频和几何等模态的学习中能否涌现出通向 AGI 的智能,并将其称为视觉通用智能(VGI)。白皮书由多位不同机构作者共同撰写,目标不是给出视觉智能的唯一定义,而是厘清 AGI 时代计算机视觉应追求的原则、视觉输入模态、基准、学习范式,以及视觉作为核心与语言等其他模态的关系。

8月25日周二
  1. qbitai62

    ResNet作者任少卿创立具身智能公司,蔚来战略投资、估值达独角兽级别

    ResNet作者、蔚来高级副总裁及智驾负责人任少卿已成立物理AI基础模型和具身智能独立公司,蔚来明确战略投资并开展业务合作,公司已完成注册、估值达独角兽级别(超10亿美元量级),名称与融资细节未披露。任少卿仍在职蔚来,其技术底色来自蔚来世界模型NWM的研发与量产推送经验,他曾多次强调世界模型是自动驾驶与机器人共享的基础范式。

8月24日周一
8月23日周日
  1. qbitai22

    无界动力 WRC 2026:隐空间世界模型 MWA™ 与具身通用大脑

    无界动力在2026世界机器人大会上集中展示以隐空间世界模型为核心的具身通用大脑MWA™,并提出“隐空间世界模型+强化学习”技术路线。创始人张玉峰称世界模型价值在于推演行动如何改变世界,公司主张“用工业练技能、用商业练泛化”。CTO夏中谱认为具身智能仍处“诸子百家”早期阶段,产品解决方案总经理沈明达则提出工业产线自动化从G1到G5的五级进化。

8月22日周六
8月21日周五
  1. HF blog71

    τ_0-VLA:世界模型引导测试时计算的分层机器人基础模型

    τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。

    推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。

  2. qbitai62

    千寻智能WRC重映整理客厅Demo:成功率与导航耗时30天内的变化

    千寻智能在2026世界机器人大会上重映了WAIC上做过的“整理客厅”长程任务Demo,并给出30天内的量化变化:可乐放入冰箱的自主推理成功率由约80%提升至99%以上,碗放入洗碗机由约90%提升至99%以上,导航目标确认耗时降低近50%,捡垃圾任务在颜色、种类、位置等泛化条件下执行成功率85%。

  3. qbitai36

    优必选WRC 2026展示工业、商用、家庭消费三大人形机器人新品

    优必选在WRC 2026集中亮相工业人形机器人Cruzr Y1、商用服务人形机器人Walker C1和超仿生人形机器人U1,覆盖工业、商用、家庭消费三大场景。Cruzr Y1与Cruzr S2现场实景演示汽车钣金件上下料、料箱拆码垛等无人自主作业;U1搭载自研Resonance-LM情感大模型,具备33轴面部肌腱网络与19个主动自由度面肌。

8月20日周四
  1. qbitai60

    星海图 WRC 最大展台展示 G0.5 模型与生产力觉醒

    量子位在 2026 年 WRC 现场观察到,星海图以 500 平方米展台、10 组 Demo 展示其具身智能成果,主题为生产力觉醒。其与京东合作的前置仓场景中,机器人端到端完成下单、取货、打包与交付,背后 G0.5 模型据现场工作人员介绍可泛化到上万种 SKU;工业装配场景中引入强化学习后操作精度做到 1mm 以内、成功率 99.9%,效率提升 400%。

  2. NVIDIA dev blog robotics60

    NVIDIA 发布 Cosmos 3 Edge,面向端侧机器人控制的后训练世界模型

    NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。

    推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。

8月19日周三
  1. qbitai22

    章鱼动力亮相WRC 2026,发布SYNWorld、OctoH-Hand与OctoSense“脑-手-数据”技术体系

    章鱼动力(SynapX)在2026世界机器人大会发布“脑-手-数据”技术体系,包括SYNWorld具身原生世界基础模型、OctoH-Hand高自由度仿生灵巧手和OctoSense下一代具身数采方案。OctoSense称全球首次实现肌电跨个体零样本泛化,让人类操作数据近乎无损对齐真机。公司三个月内获近10亿元融资,投资方包括地平线、高瓴创投、小米战投等。

8月18日周二
8月17日周一
8月15日周六
  1. qbitai38

    对话郎咸朋:昆仑行用机器人创业重做“百万智驾量产”

    理想智能驾驶前核心负责人郎咸朋与来自华为的任庚联手创办具身智能公司昆仑行,成立三个月内拿下数十亿人民币融资、跻身独角兽。郎咸朋称具身智能要解决的是“理解”而非模仿,昆仑行选择物理因果世界模型和“数据编译”路线,商业路径先从toB做起、家庭是终点。

8月12日周三
8月11日周二
  1. qbitai71

    戴盟发布全球首个物理交互脑 Daimon-TWM,获蚂蚁领投数亿元战略轮融资

    戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。

8月10日周一
  1. qbitai22

    元戎启行成立 Superfluid Lab,探索物理 AI 基座模型与研发闭环

    元戎启行成立国内首个面向物理世界基础能力研究的 AI Lab——Superfluid Lab,由前 DeepSeek 核心成员、首席科学家阮翀带队,以基座模型为核心,重点探索 VLA 模型,同时推进世界模型和多模态理解。实验室今年 5 月已在内部成立,目前完成基础设施重构等早期工作,并同步启动大模型算法、仿真算法和 AI Infra 三个方向的招聘。

  2. qbitai38

    对话郎咸朋:昆仑行要做具身智能的“蔚小理”,靠融资实现不了物理AGI

    理想汽车前智驾一号位郎咸朋今年3月创立具身智能公司昆仑行,90天内连融三轮、规模达数十亿元,成为独角兽。他判断训一个具身大模型需几十亿甚至上百亿元,只靠融资撑不到具身实现那天,量产交付自我造血才是分水岭,行业最终会跑出自己的“蔚小理”。昆仑行选择先toB再toC,从工厂上下料、物流切入,家庭放到最后落地。

8月7日周五
  1. qbitai62

    黎曼动力联合光轮智能、诺亦腾机器人共建具身数据底座,目标2026年底采集100万小时

    黎曼动力联合光轮智能和诺亦腾机器人共建具身智能数据底座,把采集、仿真、训练和评测接成一条线,并计划到2026年底完成100万小时机器人训练数据采集。黎曼动力此前用23.2万小时数据训练出Riemann-1.0,其前身为昆仑万维内部Matrix世界模型团队。三方还将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。

8月6日周四
  1. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
  1. HF blog71

    MiniWorld:从零训练视频世界模型的可复现框架

    MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。

    推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。