SteerQuant:用动作引导缩放控制世界动作模型的量化误差
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
追踪端侧部署的研究、可复用工程方法与真实部署证据。
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。
推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入面向 AI agent 的 setup、manipulation 等可复用技能与 agent-ready 文档。
推荐理由:Isaac ROS 5.0 的 agentic 工作流与 ROS Lyrical、Ubuntu 24.04 支持,为开发者提供了从开发到 Jetson 部署的完整路径参考。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
原力灵机DM0.5在RoboDojo具身评测中以综合得分24.90、平均成功率19.34%登顶,Memory维度得分47.74,Cover Blocks任务三次随机测试成功率均为100%。
推荐理由:原力灵机DM0.5登顶RoboDojo并开源权重与训练框架,读者可了解其数据、架构与推理加速的具体做法。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。
AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。
推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
NVIDIA 推出基于 Thor 架构的 Jetson T3000 与 IGX T3000 模块,提供 865 FP4 teraflops 算力,体积和功耗约为 T5000 的一半,并推出 400 FP4 teraflops、16GB 内存的 Jetson T2000。
推荐理由:原文给出两款 Thor 模块的算力、内存与上市节奏,读者可据此判断边缘端机器人算力选型与迁移路径。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
Hugging Face 的 LeRobot 发布 v0.6.0,带来多项破坏性变更:pip install lerobot 不再包含数据集与训练依赖,需按需安装如 lerobot[training]。
推荐理由:LeRobot v0.6.0 的破坏性变更清单和新增基准、策略,能帮现有用户判断升级成本与可迁移能力。
NVIDIA 在 COMPUTEX 上宣布 NVIDIA JetPack 7.2 与 NVIDIA NemoClaw 支持 NVIDIA Jetson,将智能体 AI 框架落到生产级 Jetson 软件栈上。
推荐理由:JetPack 7.2 与 NemoClaw 在 Jetson 上的组合给出了边缘智能体的部署路径,读者可据此判断现有机器人栈的升级方向。
NVIDIA 在 GTC Taipei 上发布 Factory Operations Blueprint(FOX),一套用于构建自主工厂管理智能体的参考设计,可连接机器信号、质量系统与机器人集群,并编排质检、物料运输与工人安全等专用智能体。
推荐理由:NVIDIA 公布工厂运营蓝图 FOX 的参考设计与首批落地案例,可了解工厂管理智能体的构建方式与部署路径。
NVIDIA 推出 Jetson T4000,面向机器人与边缘 AI 应用,提供最高 1200 FP4 TFLOPs 的 AI 算力和 64 GB 内存,针对更紧的功耗与散热条件优化。同步发布的 JetPack 7.1 用于加速边缘与机器人 AI 推理。
推荐理由:原文给出 Jetson T4000 的算力、内存与功耗定位,读者可据此判断边缘机器人推理硬件的选型空间。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
NVIDIA 发布 Jetson Thor,将其定位为面向物理 AI 的平台。文章称机器人正从单一用途的专用机器转向可适应多种任务的通用机器人,这类机器人结合快速反应与高层推理和规划。原文未给出具体规格、算力或上市信息。
推荐理由:NVIDIA 官方介绍 Jetson Thor 面向物理 AI 的定位,读者可了解其针对通用机器人推理与规划的硬件方向。
Open Robotics 发布 ROS 2 第十一个版本 Kilted Kaiju,主要支持 Ubuntu 24.04(amd64、arm64)和 Windows(amd64),并低层级支持 RHEL 9(amd64),支持期至 2026 年 11 月。
推荐理由:ROS 2 第十一个版本发布,读者可据此了解 Zenoh 中间件、Python 执行器与 ROSBag 回放等改动。
Open Robotics 发布第十个 ROS 2 版本 Jazzy Jalisco,这是支持到 2029 年 5 月底的长期支持版本,开箱支持 Ubuntu 24.04 和 Windows 10。
推荐理由:ROS 2 第十个版本发布,读者可了解 LTS 支持周期、Gazebo 集成方式和 rosbag 记录服务调用等具体变化。