NVIDIA 详解如何在 Jetson Thor 上用 VPI 加速机器人感知
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
Figure 02 在宝马集团 Spartanburg 工厂部署 11 个月,参与生产 3 万多辆 X3 汽车,累计运行 1250 多小时、装载 9 万多个零件,按周一至周五每天 10 小时班次运行。
推荐理由:Figure 02 在宝马工厂 11 个月的部署数据与硬件失效点复盘,为判断人形机器人产线落地阶段提供一手参考。
Nav2 发布 1.1.20,针对 Humble 分支的 Route Server 二进制构建问题进行热修复。该版本自上一版本以来包含 7 个提交,修复提交已通过 GitHub 验证签名。
Hugging Face 的 LeRobot 发布 v0.4.1,新增 EnvHub 支持从 Hub 加载仿真环境,并将 LIBERO 改为 PyPI 包安装、移除原有安装补丁。该版本还修复了数据集特征修改的关键 bug 和数据访问瓶颈以加快训练,并修正 video_key 拼写及训练中的映射边界情况。
NVIDIA 机器人研发文摘 R²D² 本期聚焦长时程操作中的感知引导任务与运动规划,指出传统 TAMP 系统依赖静态模型、在新环境中常失效。方案将感知与操作结合,使机器人能在执行过程中更新规划并适应动态场景。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
Hugging Face 的 LeRobot 发布 v0.4.0,引入 Dataset v3 与流式数据集,并新增 OpenPi、Pi0、Pi0.5 和 NVIDIA GR00T N1.5 策略支持。该版本还加入 Libero、MetaWorld 仿真环境,支持多 GPU 训练,并新增 Intel XPU 后端。完整变更见 v0.3.3...v0.4.0 变更日志。
推荐理由:LeRobot v0.4.0 的变更清单显示数据集格式与策略支持同步扩展,可据此判断现有训练流程的迁移成本。
Open Robotics 正式启用官方 Zulip 聊天服务器,将项目维护者与社区各部分汇聚到统一空间交流。该服务由 Zulip 团队 Kandra Labs 通过其开源计划免费提供托管,可使用 Zulip 高级功能。服务器可在线查看、无需注册,参与对话则需免费注册。
NVIDIA 发布教程,介绍如何借助 Omniverse NuRec,仅用智能手机完成机器人仿真场景重建。流程从用 iPhone 拍摄照片开始,经 3DGUT 重建三维场景,再加载进 NVIDIA Isaac Sim 并插入机器人。
推荐理由:原文给出用手机照片重建仿真场景并接入 Isaac Sim 的完整流程,可迁移到机器人仿真环境搭建。
Nav2 发布 1.3.10,用于 Jazzy 同步,处理动态参数导致的回归问题,以及 navigation2 元包 package.xml 中缺失 route server 的问题。该版本提交已在 GitHub 上通过验证签名。
开源机器人联盟(OSRA)技术治理委员会正式批准新的机器人增强提案(REP)流程,取代原 ROS 增强提案流程,统一覆盖 ROS、ros-controls、Gazebo、Open-RMF 和 Infrastructure 项目。治理权由单人转为各项目管理委员会(PMC),并扩展编号方案、上线新网站以便检索和区分新旧 REP。首份规范《REP-0001:2025》已发布。
Zenoh 1.6.2 发布,新增从 CARGO_PKG_VERSION 获取版本号、to_string 方法并让 IConfig 支持 Send+Sync,以及 SHM 页面预提交功能。修复了连接丢失时 queryable 信息更新的问题,并新增类似 docs.rs 的文档构建任务。
NVIDIA Jetson AGX Thor 通过软件更新将生成式 AI 吞吐量提升至 7 倍,此前发布时相对 Jetson AGX Orin 的生成式 AI 性能提升最高为 5 倍。该提升延续了 NVIDIA 软件生态持续优化的路线。
Zenoh 发布 1.6.1,重构共享内存 API 与实现并新增共享内存分配器,同时在 adminspace 和统计中暴露共享内存信息。该版本还修复了 TLS/QUIC 定位器 IPv6 地址解析、p2p 声明传播死循环、可靠消息与尽力而为消息同发时的丢包,以及多连接重连等问题。
Eclipse Zenoh 发布 1.6.0 版本,由 eclipse-zenoh-bot 于 10 月 10 日打上 v1.6.0 标签,并附上源码 zip 与 tar.gz 两个资源。该版本位于 1.5.1 与 1.6.1 之间,属于 Zenoh 1.x 系列的常规迭代。
Figure 发布第三代人形机器人 Figure 03,围绕其自研视觉语言动作模型 Helix、家庭场景和大规模制造重新设计硬件与软件。Figure 03 配备新一代视觉系统,单相机帧率提升一倍、延迟降至四分之一、视场角扩大 60%,每只手内置掌心相机,指尖触觉传感器可感知小至三克的压力。
推荐理由:Figure 03 从感知、手部到量产工艺的整体重设计,可看到人形机器人向可制造产品推进的具体路径。
NVIDIA Isaac Lab 2.3 正式发布(generally available),新增全身控制与增强遥操作,用于提升人形机器人能力。官方称从真实世界示范训练机器人策略成本高、速度慢且易过拟合,仿真优先的方法可降低风险与成本,并支持更安全、适应性更强的部署。
推荐理由:Isaac Lab 2.3 正式版带来全身控制与增强遥操作,读者可据此评估仿真优先的机器人学习流程。
NVIDIA 发布教程,介绍如何用 Isaac Lab 和 Newton 训练四足机器人运动策略,并仿真布料操作。内容围绕机器人仿真中的物理基础展开,面向研究人员和工程师,用于在安全、加速且低成本的环境中训练、开发、测试和验证机器人控制算法与原型设计。
NVIDIA 介绍三种用 OpenUSD 加速机器人开发工作流的方法。OpenUSD 是用于构建机器人学习虚拟世界的开放标准,可支撑大规模物理精确仿真,以应对机器人开发对仿真的需求增长。
NVIDIA 介绍神经机器人动力学 NeRD,用于弥补经典解析动力学在简化接触、省略运动学闭环和不可微模型上的不足。与面向特定任务的神经仿真器不同,NeRD 可作为 Newton 等物理引擎中的即插即用后端,让团队复用现有的策略学习流程。
NVIDIA Research 提出 R²D²,用三项神经突破改进机器人学习,目标是让机器人应对真实世界任务中的不可预测性、灵巧性与精细交互。当前机器人虽在受控环境中表现优异,但从装配精密部件到以类人精度操作日常物体,仍难以胜任真实部署。
Skild AI 训练了一个 omni-bodied 大脑,在包含 10 万种不同机器人的仿真环境中训练,使其能零样本控制训练中从未见过的机器人。在展示中,同一模型无需针对场景微调,就能应对断腿、锁膝、卡轮、踩高跷等形态突变,通过上下文学习在毫秒到数分钟内调整步态并恢复行走。Skild AI 认为,让模型控制所有身体而非单一或少数身体,是通向可靠物理世界 AGI 的路径。
推荐理由:Skild AI 用 10 万种机器人训练单一策略,展示零样本适应断腿、卡轮等形态突变,可观察跨本体泛化的思路。
Nav2 发布 1.4.2 版本,作为 Kilted Sync 同步更新,包含自上一版本以来的 12 个提交。该版本于 2025 年 9 月 19 日创建并带有 GitHub 验证签名。
Nav2 发布 Jazzy 同步版本 1.3.9,由 SteveMacenski 于 9 月 20 日发布,包含自上一版本以来的 45 个提交。
Figure 发布 Project Go-Big,为 Helix 视觉语言动作模型构建互联网规模的人形机器人预训练数据集,并与 Brookfield 合作,后者拥有全球超 10 万套住宅单元、5 亿平方英尺商业办公空间和 1.6 亿平方英尺物流空间。
推荐理由:Figure 公布 Helix 仅用人类第一视角视频训练即可完成真实家居导航,并披露与 Brookfield 的数据采集合作规模。
Figure 宣布与 Brookfield 达成战略合作,Brookfield 将帮助 Figure 构建其称为全球最大、最多样的真实世界人形机器人预训练数据集,并为扩展其视觉语言动作模型 Helix 建设 AI 基础设施。
NVIDIA 发布 Warp 1.9,新增全可微 wp.MarchingCubes 实现,完全用 Warp 编写并可在 CPU 和 GPU 上运行,同时修复了长期存在的 off-by-one 缺陷。
Figure 宣布 C 轮融资已获超 10 亿美元承诺资本,投后估值 390 亿美元,由 Parkway Venture Capital 领投,NVIDIA、Intel Capital、Salesforce、T-Mobile Ventures、Qualcomm Ventures 等参投。
推荐理由:Figure 公布 C 轮融资规模、估值与投资方,并说明资金将投向 Helix 平台与 BotQ 制造。
Apptronik 的人形机器人 Apollo 获得 Fast Company 2025 年“设计创新奖”人工智能设计类别奖项,此前还入选 CNBC 2025 Disruptor 50 榜单(第 33 位)和 Automotive News All-Stars 榜单。
MoveIt 2 发布 2.14.1 版本,由 v4hn 于 9 月 9 日打标签。该版本在 GitHub 上提供 2 个资源文件下载。
Figure 的视觉语言动作模型 Helix 在叠衣服、整理包裹之后,新增了装洗碗机的能力,且未引入新算法或专门工程,仅靠新数据训练。Helix 学会了将叠放的盘子分离并依次装入、单手拿起玻璃杯后换手重新调整方向再放置、根据杂乱的初始状态调整策略,以及在抓取失误或碰撞后恢复。Figure 称洗碗机装载、包裹物流和叠毛巾任务由同一通用架构完成,是迈向可扩展人形智能的一步。
推荐理由:Figure 展示同一 Helix 模型仅靠新数据学会装洗碗机,可观察通用 VLA 架构向多任务扩展的路径。
NVIDIA 发布面向 Jetson Thor 的 CUDA Toolkit 13.0,将服务器级与嵌入式 Arm 平台的 CUDA 工具链统一,开发者可一次构建并在 GB200、DGX Spark 与 Thor 上部署同一二进制,Orin(sm_87)暂不适用。
NVIDIA 发布 Isaac for Healthcare 远程手术工作流入门指南,面向远程手术场景。该工作流针对全球外科医生短缺问题——预计 2030 年缺口达 450 万,农村医院难以获得专科医生,远程手术正从实验走向必需。
NVIDIA 发布 Jetson Thor,将其定位为面向物理 AI 的平台。文章称机器人正从单一用途的专用机器转向可适应多种任务的通用机器人,这类机器人结合快速反应与高层推理和规划。原文未给出具体规格、算力或上市信息。
推荐理由:NVIDIA 官方介绍 Jetson Thor 面向物理 AI 的定位,读者可了解其针对通用机器人推理与规划的硬件方向。
Figure 的视觉语言动作模型 Helix 展示了完全自主折叠毛巾的能力,这是首个由多指手人形机器人通过端到端神经网络完成叠衣的实例。该模型沿用此前完成物流包裹重定向任务的同一架构,未修改模型或训练超参数,仅新增数据集,即可完成从混合毛巾堆中取毛巾、根据初始状态调整折叠策略、从多次抓取错误中恢复,以及用拇指描边、捏角、解开缠绕毛巾等精细操作。
推荐理由:Figure 展示 Helix 在无架构改动下从物流任务迁移到叠毛巾,可观察端到端 VLA 处理可变形物体的方式。
NVIDIA Omniverse NuRec 与 3DGUT 可从简单传感器数据重建逼真 3D 场景,并即时部署到 Isaac Sim 或 CARLA Simulator。该方案将真实环境转为交互式仿真不再需要数天或数周,文中给出了真实世界数据采集的操作步骤。
NVIDIA 在 GTC 2025 首次发布的 Cosmos Reason 是一个开放且可完全定制的推理视觉语言模型(VLM),面向物理 AI 与机器人,让机器人和视觉 AI 智能体借助先验知识、物理理解和常识进行推理,从而在真实世界中理解并行动。该模型已在 Hugging Face 的 Physical Reasoning 排行榜上登顶。
NVIDIA 在 SIGGRAPH 2025 上宣布 Isaac Sim 5.0 和 Isaac Lab 2.2 正式开放,两个机器人仿真与学习框架现已在 GitHub 上提供。Isaac Sim 是基于 NVIDIA Omniverse 构建的参考应用,可用于在物理仿真环境中构建、训练和测试 AI 驱动机器人。
推荐理由:Isaac Sim 5.0 与 Isaac Lab 2.2 正式开放,读者可了解仿真与学习框架在 GitHub 上的可用状态。
NVIDIA 在 SIGGRAPH 宣布更新 Omniverse 库和 Cosmos 世界基础模型,基于 OpenUSD 为开发者提供新的库、模型和开发工具,用于构建物理精确的虚拟环境及理解真实世界的 AI 智能体。开发者还可通过 NVIDIA Cosmos Cookbook 获取分步工作流与技术配方。
NVIDIA Research 发布 R²D²,提出用世界基础模型(WFM)与配套工作流提升机器人训练。WFM 是经过训练、可基于真实环境动态模拟、预测并推理未来世界状态的生成式 AI 模型,用于应对物理 AI 系统对丰富标注数据日益增长的需求。文中提到 NVIDIA Cosmos 是相关平台。