跳到正文

端侧部署

追踪端侧部署的研究、可复用工程方法与真实部署证据。

20条精选

最新精选

第 1–20 条 · 共 20 条
今天10月1日周四
  1. arXiv cs.RO62

    SteerQuant:用动作引导缩放控制世界动作模型的量化误差

    SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。

    推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。

  2. arXiv cs.RO62

    Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

    Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

    推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。

9月22日周二
  1. NVIDIA blog robotics78

    NVIDIA 发布 Isaac ROS 5.0,支持 ROS Lyrical 与 agentic 开发工作流

    NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入面向 AI agent 的 setup、manipulation 等可复用技能与 agent-ready 文档。

    推荐理由:Isaac ROS 5.0 的 agentic 工作流与 ROS Lyrical、Ubuntu 24.04 支持,为开发者提供了从开发到 Jetson 部署的完整路径参考。

9月10日周四
  1. HF blog62

    用 HF Jobs 与 Storage Bucket 实现跨机 Async GRPO LoRA 训练

    Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。

    推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。

8月25日周二
8月20日周四
  1. NVIDIA dev blog robotics60

    NVIDIA 发布 Cosmos 3 Edge,面向端侧机器人控制的后训练世界模型

    NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 Nemotron 的 2B 推理器。原文指出机器人需要能适应自身传感器、环境和任务、同时运行在机载计算硬件上的策略,而世界模型虽然为学习物理交互提供了基础,但其体积会让端侧部署变得困难,Cosmos 3 Edge 正是针对这一问题。

    推荐理由:NVIDIA 公布 Cosmos 3 Edge 的 4B 参数与 2B 推理器配置,读者可了解世界模型在机载硬件上部署的取舍。

8月14日周五
  1. HF blog70

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制、训练与部署闭环

    AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。

    推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。

7月29日周三
  1. BAIR62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。

    推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。

7月27日周一
  1. HF blog74

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。

    推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。

7月20日周一
7月16日周四
  1. NVIDIA blog robotics78

    NVIDIA 推出 Jetson T3000 与 T2000 模块,扩展边缘 AI 机器人平台

    NVIDIA 推出基于 Thor 架构的 Jetson T3000 与 IGX T3000 模块,提供 865 FP4 teraflops 算力,体积和功耗约为 T5000 的一半,并推出 400 FP4 teraflops、16GB 内存的 Jetson T2000。

    推荐理由:原文给出两款 Thor 模块的算力、内存与上市节奏,读者可据此判断边缘端机器人算力选型与迁移路径。

7月10日周五
  1. qbitai78

    蚂蚁灵波发布 LingBot-VA 2.0 具身原生预训练 VA 基座模型

    蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。

    推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。

7月8日周三
6月2日周二
6月1日周一
  1. NVIDIA blog robotics60

    NVIDIA 发布 Factory Operations Blueprint(FOX)工厂 AI 蓝图

    NVIDIA 在 GTC Taipei 上发布 Factory Operations Blueprint(FOX),一套用于构建自主工厂管理智能体的参考设计,可连接机器信号、质量系统与机器人集群,并编排质检、物料运输与工人安全等专用智能体。

    推荐理由:NVIDIA 公布工厂运营蓝图 FOX 的参考设计与首批落地案例,可了解工厂管理智能体的构建方式与部署路径。

1月6日周二
  1. NVIDIA dev blog robotics60

    NVIDIA 发布 Jetson T4000 与 JetPack 7.1,加速边缘与机器人 AI 推理

    NVIDIA 推出 Jetson T4000,面向机器人与边缘 AI 应用,提供最高 1200 FP4 TFLOPs 的 AI 算力和 64 GB 内存,针对更紧的功耗与散热条件优化。同步发布的 JetPack 7.1 用于加速边缘与机器人 AI 推理。

    推荐理由:原文给出 Jetson T4000 的算力、内存与功耗定位,读者可据此判断边缘机器人推理硬件的选型空间。

11月26日周三
8月26日周二
  1. NVIDIA dev blog robotics76

    NVIDIA 发布 Jetson Thor,面向物理 AI 的计算平台

    NVIDIA 发布 Jetson Thor,将其定位为面向物理 AI 的平台。文章称机器人正从单一用途的专用机器转向可适应多种任务的通用机器人,这类机器人结合快速反应与高层推理和规划。原文未给出具体规格、算力或上市信息。

    推荐理由:NVIDIA 官方介绍 Jetson Thor 面向物理 AI 的定位,读者可了解其针对通用机器人推理与规划的硬件方向。

5月24日周六
5月31日周五