NVIDIA Research 在 CVPR 发布 GraspGen-X、LCDrive 与 NitroGen 三项研究
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。
推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。
Google DeepMind 在实验性原型 Project Genie 中上线 Street View 实景锚定能力,可基于美国地点影像生成可交互世界,并支持“Desert Sands”“Stone Age”“Ocean World”“B&W film”等风格。
BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。
推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。
NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。
NVIDIA 发布 Alpamayo,面向自动驾驶的推理式视觉语言动作(VLA)模型,可将决策过程展开为逐步推理轨迹。该模型被视为在语义空间中运行的隐式世界模型,用于处理复杂驾驶问题。
NVIDIA 将开源机器人参考框架 Isaac Sim 与 World Labs 的生成模型 Marble 结合,可从文本提示直接生成照片级、可直接用于仿真的 3D 世界,替代以往需数周手工建模的流程。该方案面向机器人仿真环境构建,原文未披露具体版本号、成功率或性能数据。
NVIDIA 发布 Cosmos Cookbook,介绍如何用 Cosmos 开放世界基础模型(WFM)为物理 AI 扩展高保真合成数据生成。该方案针对真实世界数据集采集成本高、耗时长且危险的问题,支持可扩展的合成数据生成与数据增强。
NVIDIA 在 SIGGRAPH 宣布更新 Omniverse 库和 Cosmos 世界基础模型,基于 OpenUSD 为开发者提供新的库、模型和开发工具,用于构建物理精确的虚拟环境及理解真实世界的 AI 智能体。开发者还可通过 NVIDIA Cosmos Cookbook 获取分步工作流与技术配方。
NVIDIA Research 发布 R²D²,提出用世界基础模型(WFM)与配套工作流提升机器人训练。WFM 是经过训练、可基于真实环境动态模拟、预测并推理未来世界状态的生成式 AI 模型,用于应对物理 AI 系统对丰富标注数据日益增长的需求。文中提到 NVIDIA Cosmos 是相关平台。