NVIDIA 发布 Alpamayo 2 Super 开源推理视觉模型
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
curobo_ros v2 已迁移到 cuRobo v0.8.0,这一上游版本为大幅重写,封装包随之更新。新版内置 block-sparse TSDF 与 GPU ESDF 建图,深度相机统一输出单一 Scene 对象,MotionPlanner API 将单姿态、批量、目标集与多环境规划合并为统一接口,并加入基于 B 样条的动力学轨迹优化。
黄仁勋在Y Combinator访谈中称Agent是一种新的软件形态,不必达到100%准确才有价值,可控性可能是其下一阶段最大突破口。他表示AI消灭的是任务而非工作,编码正被自动化但软件工程师岗位同比增长约10%,并称物理AI开启新增长曲线,机器人将撑起英伟达下一个千亿美元市场。
World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。
推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。
NVIDIA 提出以 GPU 原生医学物理仿真开发医疗机器人,应对医疗机器人无法依赖互联网规模数据采集和无限真实世界实验的问题。每项示范都需要专用设备、临床专业知识和患者或实验室环境的使用权限,由此带来数据缺口等三大挑战。
NVIDIA 展示 Jetson 边缘 AI 与机器人平台,Jetson Orin Nano Super 提供 67 TOPS 算力,可本地运行 Reachy Mini 语音视觉助手等首个机器人项目。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
ROS 发布本周动态:Nav2 团队发布不同计算平台在仿真导航基准上的性能对比,ROS 基础设施团队上线 Buildfarm 仪表盘,集中展示 ROS 与 Gazebo 包的构建和测试失败情况。此外还有 25kg 负载六足机器人、基于 TensorRT 加速的 Fast-FoundationStereo 立体深度估计 ROS 2 Jazzy 工作空间,以及 ROSCon 多站活动日程。
佐治亚理工助理教授Danfei Xu发起第一视角人类操作数据生态EgoVerse,公开版本含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者,联盟伙伴包括佐治亚理工、斯坦福、苏黎世联邦理工、UC San Diego以及Meta、Scale AI、光轮智能等公司。
Nav2 作者 Steve Macenski 开源了一套机器人工作负载基准,用完整自主栈运行叉车抓取放置任务,而非孤立的合成微基准。该基准处理来自 3D LIDAR、深度相机等的 9 路传感器流,在 180,000 平方英尺仓库中运行完整自主栈并叠加较重的 VLM 负载,已对 AMD Strix Halo、NVIDIA Jetson Thor 和 Orin AGX 进行测试。
NVIDIA 开源 Medical Physics Simulation 框架,作为 Isaac for Healthcare 内的 GPU 加速能力,用于建模解剖结构与器械交互、生成难以采集的场景并训练或评估机器人策略。
推荐理由:原文给出框架的仿真能力、开源入口与并行训练数据,读者可据此判断医疗机器人仿真工作流的复用方式。
Nvidia Jetson 全系套件与模组涨价 50%-100%,有用户在 ROS Discourse 发帖征集替代方案并附投票。讨论中 RK3588 被多次提及,Orange Pi 5、NanoPC T6 均基于该芯片,8GB 内存板卡约 200 美元起,且带 h264 硬件编码便于远程监控与遥操作。
作者开源了 ros2-fast-stereo,一个基于 ROS 2 Jazzy 的实时立体深度估计工作区,用 TensorRT 加速移植 NVIDIA 的 Fast-FoundationStereo 模型。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
Autoware 发布免费开源的 L2 自动驾驶栈 Vision Pilot,AMD 同期启动 Physical AI 黑客松,提供 3 万美元奖金和免费 GPU 算力,8 月 6 日截止提交。ROS 核心贡献者一周内收到近 50 个未标注为 AI 生成的 PR,团队为此新建 triage 看板并呼吁提交者参与评审。
Nav2 集成 Meta 的 SAM3 基础模型实现通用语义导航,在 AMD Strix Halo(Ryzen AI Max+ 395)上端侧运行,以 5-10 Hz 输出逐像素掩码。
友机技术连续完成B轮、C轮融资,金浦投资、九派资本入场,中国移动链长基金战略投资成为其重要产业投资方。该公司聚焦设备端工业AI,将机床状态转化为AI可理解的数据语言,并推动AI进入实时反馈与控制优化闭环,已在航空航天、军工、汽车制造、3C电子等行业形成应用积累。其UJ-Ucut优切仿真系统于2026年获国产数控机床领域“春燕奖”。
无问芯穹联合清华大学等研发的具身智能强化学习基础设施 RLinf 升级至 v0.3,首次完整打通数据采集、数据管理、SFT、RL、模型评测与真机部署环节,形成从仿真训练到真机在线学习的统一开发闭环。
NVIDIA 推出基于 Thor 架构的 Jetson T3000 与 IGX T3000 模块,提供 865 FP4 teraflops 算力,体积和功耗约为 T5000 的一半,并推出 400 FP4 teraflops、16GB 内存的 Jetson T2000。
推荐理由:原文给出两款 Thor 模块的算力、内存与上市节奏,读者可据此判断边缘端机器人算力选型与迁移路径。
NVIDIA 提出用 AI 智能体加速开发轻量级 OpenUSD 运行时。OpenUSD 是面向物理 AI 的开放可扩展框架,提供通用场景描述语言,可将 CAD 数据、仿真资产和真实遥测数据整合到统一的物理精确视图中。此前构建 USD 实现通常需要改造大型现有代码库,即便团队只需特定内存占用。
NVIDIA 发文讨论通用机器人策略在真实世界部署前的评估难题,指出当前最强系统已能按自然语言指令完成抓取、放置、分拣和操作多种物体,但严格评估仍是该领域最难解决的未解问题之一。文章介绍了其中的关键问题及 NVIDIA 的应对方法。
NVIDIA 发布文章介绍如何用 Isaac GR00T 端到端开发人形机器人策略。文章指出,随着团队从人形机器人整机调试转向特定任务技能开发,对可重复开发工作流的需求正在增长,而当前开发流程仍高度碎片化,开发者需要花大量时间配置机器人基础设施,之后才能专注于构建机器人能力。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
WAIC 2026 将聚焦世界模型路线之争,围绕 VLA 与世界模型的替代、并存、融合三种猜想展开讨论。论坛汇聚大晓机器人王晓刚、诺奖得主托马斯·萨金特及英伟达等代表,萨金特以开普勒式描述模型与牛顿式结构模型为行业路线定调。
英伟达 GEAR 联合李飞飞团队、佐治亚理工大学等机构发布 Real2Sim 系统 SimFoundry,只需一段真实世界 RGB 视频即可自动生成可交互、可训练、可评测的机器人仿真环境。
推荐理由:英伟达 GEAR 与李飞飞团队等提出 Real2Sim 系统,用一段视频自动扩展仿真训练数据,读者可了解其闭环思路与实验结论。
NVIDIA 发布 Isaac Lab v3.0.0-beta2.patch1,在 Isaac Lab 3.0.0 Beta 2 基础上更新支持 Isaac Sim 6.0.1,包含针对 NuRec 工作流的修复与改进。
英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。
推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。
群核科技三篇论文入选 ECCV 2026,涵盖空间感知与推理、强化学习数据生成、高保真物理仿真。其中联合 Adobe、NVIDIA、Apple、Intel 等提出的 SPEAR 仿真平台开放超 14000 个原生 Python 接口,可输出深度图、表面法线、实例分割等物理属性数据,并接入 InteriorAgent、InteriorGS 等结构化三维数据集。
NVIDIA 机器人软件工程师 Jaiveer Singh 领导 Isaac ROS 团队,基于开源 ROS 2 框架为自主移动机器人、操作和人形系统提供 CUDA 加速库与 AI 模型。
NVIDIA 介绍基于 OpenUSD 和 Omniverse 的三种视觉 AI 智能体工作流:用 Defect Image Generation 技能生成合成缺陷数据、用 Video Data Augmentation 扩展场景覆盖、用 TAO 技能微调模型。
Firefly Aerospace 的 Blue Ghost Mission 2 将搭载 Ocula 月球成像服务,首次在月球轨道运行 NVIDIA Jetson 边缘 AI 平台,直接在轨推理并近实时回传关键信息,而非下传全部原始数据。
NVIDIA 推出 Halos for Robotics 全栈功能安全系统,面向在工厂、仓库、医院和家庭中与人自主共处的物理 AI 机器人。该系统针对机器人走出围栏、环境愈发非结构化后传统安全方案失效的问题,以 AI 驱动的安全为核心。NVIDIA 称这是物理 AI 到来过程中的一个重要里程碑。
Isaac Lab 3.0 Beta 2 发布,作为 3.0 beta 的稳定化版本,兼容 Isaac Sim 6.0.0,扩展了 Newton 支持(VBD、求解器耦合、Kamino、崎岖地形、传感器)与多后端物理,并简化训练和安装命令。
推荐理由:Isaac Lab 3.0 Beta 2 汇总了多后端物理、Newton 与无 Kit 工作流的改动,可据此判断升级与迁移成本。
NVIDIA 提出世界动作模型(WAM)概念,指从预训练世界模型或视频模型出发、再微调为机器人策略的一类模型,与从 VLM 骨干起步的 VLA 形成对照。文中以 Pi-0 和 GR00T N1 作为 VLA 的代表案例。
NVIDIA 在 GTC Taipei 上披露多项 robotaxi 合作:Uber 与 Autobrains 在慕尼黑基于 NVIDIA Hyperion 平台启动 robotaxi 项目,Foxconn 扩大合作在台湾部署车队,VinFast 与 Autobrains 面向东南亚推 L4 车辆,HUMAIN 则将 Hyperion 方案引入沙特。
NVIDIA 与斗山集团扩大合作,覆盖斗山机器人、斗山山猫、斗山恒能和斗山电子材料 BG,将 NVIDIA 全栈加速计算平台与斗山工业自动化、发电和电子材料能力结合。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA 在 CVPR 发布面向物理 AI 研究的 agent skills,帮助研究者自动化自动驾驶、机器人和视觉 AI 的开发流程。
推荐理由:NVIDIA 在 CVPR 发布面向物理 AI 的 agent skills,读者可了解其覆盖自动驾驶、视觉 AI 与机器人学习的工具链与开放入口。
NVIDIA 在 COMPUTEX 上宣布 NVIDIA JetPack 7.2 与 NVIDIA NemoClaw 支持 NVIDIA Jetson,将智能体 AI 框架落到生产级 Jetson 软件栈上。
推荐理由:JetPack 7.2 与 NemoClaw 在 Jetson 上的组合给出了边缘智能体的部署路径,读者可据此判断现有机器人栈的升级方向。