跳到正文

#部署/工程

今日 4 条
今天10月1日周四
  1. arXiv cs.RO62

    SteerQuant:用动作引导缩放控制世界动作模型的量化误差

    SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。

    推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。

  2. arXiv cs.RO62

    Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

    Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

    推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。

  3. arXiv cs.RO39

    CGRAS:用机器人与计算机视觉自动监测珊瑚幼苗

    澳大利亚研究团队提出珊瑚培育机器人评估系统 CGRAS,结合机器人成像与计算机视觉,自动完成珊瑚多物种检测计数与健康评估,并提取生长、存活和空间分布指标。该系统在大型水产养殖设施的标准珊瑚附着基上验证,相比人工监测将时间和人力成本降低 9.6 倍,对 Acropora kenti 珊瑚的计数与专家结果一致率达 96.4%。

8月18日周二
7月29日周三
  1. BAIR62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。

    推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。

7月24日周五
  1. Robohub36

    巴塞尔大学研发 MIR 微型口腔机器人,简化牙冠预备流程

    巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。

7月21日周二
  1. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月8日周三