跳到正文

世界模型

追踪世界模型的研究、可复用工程方法与真实部署证据。

37条精选

最新精选

第 21–37 条 · 共 37 条
8月5日周三
  1. HF blog71

    MiniWorld:从零训练视频世界模型的可复现框架

    MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。

    推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。

8月4日周二
  1. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。

7月30日周四
  1. qbitai78

    World Labs 发布 R2S2R 机器人策略训练与评估引擎

    World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。

    推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。

7月28日周二
  1. HF blog62

    论文提出具身操作数据金字塔,梳理五类数据来源与数据配方

    论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。

    推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。

7月27日周一
  1. HF blog74

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。

    推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。

7月26日周日
7月20日周一
  1. Robohub82

    交互式世界模拟器:用动作条件视频预测训练与评测机器人策略

    作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。

    推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。

7月19日周日
7月16日周四
  1. qbitai78

    原力灵机发布具身世界模型 DW0.5,接入 DFOL2.0 后训练框架

    原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。

    推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。

7月14日周二
  1. qbitai76

    高德发布通用世界模型工坊ABot-World Studio,5090单卡可生成小时级交互视频与3D场景

    阿里巴巴旗下高德发布通用世界模型工坊ABot-World Studio并开放测试,可将文字或图片生成可实时交互的AI世界,输出为视频与3DGS文件。该工坊可在单张5090上本地部署,官方实测单次连续推理稳定运行超1小时且无质量衰减,并内置“时空任意门”实现3D世界间跃迁。底层ABot-World0与ABot-3DWorld0模型已全面开源,官网、GitHub及Hugging Face同步上线。

    推荐理由:高德把交互式视频与3DGS场景生成统一进一个工坊,并开源模型,读者可据此了解世界模型的一条新路径。

7月10日周五
  1. HF blog60

    AlayaWorld:长时程可交互视频世界生成框架开源

    AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。

    推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。

  2. HF blog71

    RynnWorld-Teleop:面向数字遥操作的动作条件世界模型

    论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。

    推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。

  3. HF blog71

    RynnWorld-4D:面向机器人操作的 4D 具身世界模型

    RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。

    推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。

7月7日周二
  1. HF blog88

    LeRobot v0.6.0 发布:世界模型策略、新 VLA 与奖励模型 API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。

6月3日周三
  1. NVIDIA blog robotics74

    NVIDIA Research 在 CVPR 发布 GraspGen-X、LCDrive 与 NitroGen 三项研究

    NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。

    推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。

6月1日周一
  1. NVIDIA dev blog robotics62

    NVIDIA 发布物理 AI 基础模型 Cosmos 3

    NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。

    推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。

4月20日周一
  1. BAIR62

    GRASP:面向世界模型长时程规划的梯度规划器

    BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。

    推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。