SteerQuant:用动作引导缩放控制世界动作模型的量化误差
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。
推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。
澳大利亚研究团队提出珊瑚培育机器人评估系统 CGRAS,结合机器人成像与计算机视觉,自动完成珊瑚多物种检测计数与健康评估,并提取生长、存活和空间分布指标。该系统在大型水产养殖设施的标准珊瑚附着基上验证,相比人工监测将时间和人力成本降低 9.6 倍,对 Acropora kenti 珊瑚的计数与专家结果一致率达 96.4%。
针对分散式机器人车队观测与通信范围受限的问题,研究者提出 HALO 混合方法,将车辆路径问题拆分为分配与路由两部分,为动态环境中的机器人提供车载实时解。分配阶段采用异构图神经网络与独特消息传递层,分离空间分布和任务-机器人兼容性的学习。
加拿大舍布鲁克大学团队在 IEEE Transactions on Field Robotics 发表研究,介绍 Ice Dart 无人机用可伸缩微型冰刺在冰岛东南部冰川与冰山上着陆。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。
JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。
智源研究院悟界·RoboBrain Orca Team发布技术报告Orca: The World is in Your Mind,提出Next-State Prediction路线,先学习统一的世界状态表征,再从中读出理解、预测与行动能力。