面向 Class 8 卡车的驾驶 VLA 数据高效适配方法
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
NVIDIA 在 CES 上展示 Caterpillar 座舱 AI 助手,基于 Jetson Thor 本地运行 Nemotron 语音模型与 Qwen3 4B,无需云端连接。
NVIDIA 在 CES 展示 Caterpillar 座舱内 Cat AI Assistant 原型,基于 Jetson Thor 本地运行 Nemotron 语音模型与 vLLM 服务的 Qwen3 4B,无需云端连接。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
推荐理由:梳理AMD收购World Labs的交易结构、技术合作脉络与各轮投资人回报,可看清芯片巨头布局空间智能的路径。
strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。
推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。
cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。
推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
一位卫星公司工程师公开了为 NASA 提案 / USSF 合同提交的轨道空间机器人仿真工作,使用 Isaac Sim 5.1 与 ROS 2 Jazzy 完成航电与轨道动力学仿真,已获准公开发布。该提案已提交 NASA,第二阶段有望引入 agentic ROS。作者称这是其已知首个用 ROS 仿真在轨空间机器人的项目。
作者将 NVIDIA Isaac ROS cuMotion 与 AI Worker 的 MoveIt 2 栈集成,实现碰撞感知运动规划,同一套规划流程可协调左臂、右臂、双臂和升降机构。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入面向 AI agent 的 setup、manipulation 等可复用技能与 agent-ready 文档。
推荐理由:Isaac ROS 5.0 的 agentic 工作流与 ROS Lyrical、Ubuntu 24.04 支持,为开发者提供了从开发到 Jetson 部署的完整路径参考。
NVIDIA 介绍如何借助上游抽象层与 CUDA buffer 后端,让 AI Agent 加速 ROS 2 节点,避免消息在节点间经 CPU 内存序列化或拷贝而抵消 GPU 加速收益。仅靠快速 CUDA kernel 并不能保证 ROS 2 图变快,感知与 AI 负载留在 GPU 上的优势可能被传输开销侵蚀。
NVIDIA 推出 Halos,称其为首个也是唯一一个面向物理 AI 的全栈安全系统,覆盖设计、验证与部署各层。
Lucid Motors 与欧洲出行平台 Bolt 达成合作,Bolt 计划部署至少 25,000 辆基于 Lucid 中型电动车平台打造的全自动驾驶车辆,并将拥有和运营该车队。双方将从产品开发阶段就共同打造支持自动驾驶系统(ADS)的车辆平台,车辆采用英伟达 Hyperion 计算与感知架构,但未公布自动驾驶软件供应商。目前双方未发生资金往来,Bolt 也未下单,且无公开部署时间表。
Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。
推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。
研究显示,针对视觉语言动作(VLA)模型的后门攻击 BadVLA 可在触发器出现时让机器人动作轨迹产生条件性偏移,无触发器时任务表现基本正常;GoBA 用咖啡杯等普通物体作触发器,报告 97% 攻击成功率且不降低干净输入上的表现。
英伟达 Inception 全球物理 AI 负责人 Les Karpas 将在 TechCrunch Disrupt 2026 的 Real World AI Stage 发表演讲,主题为机器人为何仍在等待自己的 ChatGPT 时刻、障碍何在。
Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。
推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。
全球 Robotaxi 市场预计到 2035 年达 4000 亿美元,超 600 万辆商用车上路,NVIDIA 以训练、仿真验证、车载三计算机架构支撑商业化车队规模化部署。
GOSIM Shenzhen 2026 将于 10 月 16–17 日在深圳南山伊敦酒店举办,这是该开源技术大会首次来到深圳,汇聚 150+ 国际讲师和 2000+ 全球开发者。
影眸 Hyper3D 发布世界生成模型 WorldGen,上传一张场景图后约 2 到 3 分钟可生成完整 3D 场景,场景内每件资产可单独移动、替换,并保留空间与物理关系。
TechCrunch Disrupt 2026 新增 Real World AI Stage,聚焦数字与物理世界交汇,阵容包括 Nvidia 物理 AI 负责人 Les Karpas、Shield AI CTO Nate Michael、Colossal Biosciences CEO Ben Lamm、FieldAI 创始人 Ali Agha 等。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
Hugging Face 发布开源鸭子机器人 Microduck,售价 399 美元,圣诞节前发货。这款高 25 厘米的机器人能摇摆行走、用喙叼取物品、跌倒后自行站起、蹲下甚至滑旱冰,通过摄像头、激光雷达和两个 IMU 感知环境。Pollen Robotics 表示其行为可在仿真中训练并直接部署到机器人上,SDK、仿真和完整强化学习训练栈已在 GitHub 开放。
NVIDIA 介绍用 AI 智能体训练跨本体机器人导航策略的方法。导航需持续定位、理解环境、选路并避障,与仅产生稳定运动的行走不同;迁移到新机器人或新场景通常需要新数据、仿真资产和机器人接口。
为机器人构建 AI 大脑的开发者正试图复刻前沿 AI 实验室的路径,靠更多样数据集、不同训练方案和强化学习场景突破物理 AI 的“GPT-2 时代”。Foxglove 在 Actuate 大会上发布基于 Nvidia Cosmos 开放权重世界模型的新产品,支持用自然语言查询数据以加速评估与仿真。
Waymo 自研了一款 5nm ASIC 芯片,用于在原始数据进入自动驾驶系统核心"大脑"前进行处理,算力超过 1000 TOPS,性能大致与英伟达最新 DRIVE AGX Thor 汽车处理器相当。
优必选在 WRC 上1:1复刻客户真实产线,用近十台工业人形机器人 Cruzr S2 和 Cruzr Y1 连续演示汽车机加件与钣金件上下料、拆码垛和物流小件分拣,定位精度小于1mm,物流分拣平均抓取节拍接近1100件/小时。
中坚科技旗下桦之坚的概念人形机器人ZERO在2026世界机器人大会亮相,高达两层楼,造型由艺术家朱高文操刀,基于NVIDIA Isaac平台完成多场景预训练。同台展出的还有已商业化的工业级四足机器人灵睿P1,以及基于该平台二次开发、搭载水炮的消防机器狗,最大射程60米。中坚智氪自研轮毂电机、行星关节模组同步展出,自建工厂产线月产能可达千台以上。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
NVIDIA 发布 JetPack 7.2.1,为 Jetson 平台新增智能体视频技能与 T3000 仿真能力。该版本面向机器人、智能视频分析、工业自动化等场景,覆盖多路摄像头采集、网络流解码、AI 推理与传统视觉处理、结果绘制及视频编码存储或传输等完整视频数据链路。
戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
一位 Nav2 新手在 Isaac Sim 中用搭载单个前置 2D LiDAR 的官方 Nova Carter AMR 做导航,小型室内工厂环境正常,AMCL 定位稳定;换到大型道路环境后机器人开始 zigzag 行驶,并逐渐偏离道路甚至跑到路边,而 RViz 仍显示机器人在路中央,与 Isaac Sim 中的实际位置明显不一致。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
作者发布实验性 ROS 2 库 ros2_cuda_ipc,通过 CUDA VMM 文件描述符在进程间共享 GPU 数据,避免经 CPU 内存拷贝,并提供 CUDA 事件流同步与多消费者缓冲区生命周期管理。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
curobo_ros v2 已迁移到 cuRobo v0.8.0,这一上游版本为大幅重写,封装包随之更新。新版内置 block-sparse TSDF 与 GPU ESDF 建图,深度相机统一输出单一 Scene 对象,MotionPlanner API 将单姿态、批量、目标集与多环境规划合并为统一接口,并加入基于 B 样条的动力学轨迹优化。