面向 Class 8 卡车的驾驶 VLA 数据高效适配方法
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
论文提出一个开源 BlueROV2 平台,将机载视觉与非线性模型预测控制(NMPC)结合,用于受限环境下的自主导航与对接。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。
推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
英伟达 GEAR 联合李飞飞团队、佐治亚理工大学等机构发布 Real2Sim 系统 SimFoundry,只需一段真实世界 RGB 视频即可自动生成可交互、可训练、可评测的机器人仿真环境。
推荐理由:英伟达 GEAR 与李飞飞团队等提出 Real2Sim 系统,用一段视频自动扩展仿真训练数据,读者可了解其闭环思路与实验结论。
群核科技三篇论文入选 ECCV 2026,涵盖空间感知与推理、强化学习数据生成、高保真物理仿真。其中联合 Adobe、NVIDIA、Apple、Intel 等提出的 SPEAR 仿真平台开放超 14000 个原生 Python 接口,可输出深度图、表面法线、实例分割等物理属性数据,并接入 InteriorAgent、InteriorGS 等结构化三维数据集。
NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。
推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。
NVIDIA 提出 R²D²,利用仿真与语言模型改进机器人操作,以应对真实动态环境中物体、光照和接触动力学变化带来的挑战。该方法针对仿真到现实的差距以及夹爪或工具未优化的问题,目标是提升机器人泛化能力、长时序任务执行与跨任务灵巧操作水平。
NVIDIA 机器人研发文摘 R²D² 本期聚焦长时程操作中的感知引导任务与运动规划,指出传统 TAMP 系统依赖静态模型、在新环境中常失效。方案将感知与操作结合,使机器人能在执行过程中更新规划并适应动态场景。
NVIDIA Research 提出 R²D²,用三项神经突破改进机器人学习,目标是让机器人应对真实世界任务中的不可预测性、灵巧性与精细交互。当前机器人虽在受控环境中表现优异,但从装配精密部件到以类人精度操作日常物体,仍难以胜任真实部署。