跳到正文
2026 年第 40 周 · 09.28 — 10.04每周一出刊

AI 周报 · 2026 年第 40 周 · 09.28 — 10.04

具身雷达

第 2 期402026 年第 40 周09.28 — 10.04
19件大事62条精选7期日报约 8 分钟读完
本期导读

人形全身模型与数据高效适配进展

本期(2026-09-28 至 2026-10-04)共收录 40 项机器人与具身智能研究,覆盖人形全身控制、数据高效适配、记忆与长时程操作、仿真到真实迁移、灵巧操作与触觉、世界模型与推理加速等方向。人形方向出现 λ0 第一视角预训练全身移动操作模型、Fiatlux 爬梯换灯泡长时程基准、CEER2 柔顺移动操作框架等进展;数据效率方面,EmbodiRSI 通过递归自改进将自主仿真成功率从 50.4% 提升至 83.5%,SimEX 仅用 10 分钟真机交互完成自动研究,Real2Sim2Real 协同训练将动态灵巧抓取成功率从 52% 提升至 86%。记忆机制成为长时程 VLA 操作的重要线索,ECoMEM、Divide-and-Remember、HIDE 基准分别从显式概念记忆、递归动作相关记忆和技能级记忆评测切入。此外,世界动作模型推理加速、VLA 强化学习与动作验证、灵巧手遥操作与跨本体抓取等方向亦有密集产出。

01

人形全身移动操作

本版导读人形机器人全身移动操作在本期集中出现多项进展。λ0 提出全身人形视觉语言动作策略,通过三阶段训练先学习第一视角交互数据,再用 HumanVerse-500 协调身体与手部运动,最后适配下游任务与机器人本体。Fiatlux 基于 NVIDIA Isaac Lab 构建长时程基准,让 Unitree G1 在一个回合内完成放梯、爬梯、换灯泡并回收旧灯泡。CEER2 提出方向可调末端执行器与根部柔顺框架,用分层强化学习调制全身跟踪策略。此外,DTMR 面向腿足机器人做稠密时序动作重定向,在四款人形机器人、两小时人体动作数据上评测,动态动作表现优于基线。

arXiv cs.RO10.01

CEER2:面向人形机器人移动操作的方向可调末端执行器与根部柔顺框架

CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。

arXiv cs.RO10.01

DTMR:面向腿足机器人的稠密时序动作重定向

作者提出稠密时序动作重定向(DTMR),在单个优化中联合优化时序与控制,对每个控制步调整时序,并用基于采样的 MPC 在 GPU 上并行求解。在四款人形机器人、两小时人体动作数据上评测,DTMR 优于基线,尤其在跳跃等动态动作上;相同形变预算下比优化时间维度的基线重定向更精确且快约 19 倍。用其参考动作训练的策略已迁移到真实人形机器人。

02

数据高效机器人适配

本版导读数据高效适配本期出现多条可量化进展。EmbodiRSI 在真实到仿真再回真实流程中递归自改进,三个桌面环境和 14 个子任务经两轮更新后,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。SimEX 将仿真实验与编码智能体结合,在毛巾折叠、条码扫描和盘子操作上无需示范、仅用 10 分钟真机交互即可获得机器人工具。Real2Sim2Real 协同训练将世界对齐与行为对齐作为独立轴,动态灵巧抓取分拣任务成功率从 52% 提升到 86%,平均来看世界对齐提升 18 个百分点。URAI 则让编程智能体编写、调用并演化可复用机器人工具。

arXiv cs.RO10.01

EmbodiRSI:面向数据高效机器人适配的递归自改进系统

EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。

arXiv cs.RO10.01

SimEX:仿真集成的机器人自动研究框架

SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。

arXiv cs.RO10.02

Real2Sim2Real 协同训练中的世界与行为对齐研究

该论文提出 real2sim2real 流程,将世界对齐(仿真与真实系统一致)与行为对齐(仿真轨迹与人类运动一致)作为两条独立轴生成协同训练数据。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;平均来看,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

arXiv cs.RO10.01

URAI:让前沿智能体编写、调用并演化机器人工具

论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。

03

长时程记忆与部分可观测

本版导读记忆机制成为长时程 VLA 操作的核心议题。ECoMEM 用可复用的显式概念库表示任务相关历史,由基于证据的 Writer 选择更新记录,再由学习到的 Reader 转成记忆 token 直接条件化 VLA。Divide-and-Remember 从模仿学习的 POMDP 表述出发,将最优记忆定义为最大化动作与记忆条件互信息,并把全历史选择递归拆分为 2K 个 token 中选 top-K 的子问题。HIDE 基准与 SEEK 框架面向部分可观测操作,包含重复计数、历史状态回忆和执行进度跟踪三类共 15 项任务。

arXiv cs.RO10.02

Divide-and-Remember:面向长时程 VLA 策略的递归动作相关记忆

论文提出 Divide-and-Remember(D&R)递归记忆方法,用于历史依赖的长时程 VLA 操作任务。该方法从模仿学习的 POMDP 表述出发,将最优记忆定义为在当前观测下最大化动作与记忆条件互信息,并把全历史选择递归拆分为 2K 个 token 中选 top-K 的子问题,所有递归块共享同一选择器。

04

世界模型与推理加速

本版导读世界动作模型与 VLA 推理效率受到集中关注。Sparse-WAM 利用动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出动作引导稀疏想象,免训练加速世界动作模型推理。SteerQuant 面向世界动作模型提出 4-bit 量化框架,映射各语义流量化误差对最终动作的影响以引导共享通道缩放。Kinematic MeanFlow 提出面向机器人基础模型的一步动作生成策略,缓解多步流匹配的高推理延迟。DriftOPD 则对连续 VLA 动作专家做序列级 on-policy 蒸馏,将序列级反向 KL 分解为 chunk 级项与未来势能项。

arXiv cs.RO10.01

Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

arXiv cs.RO10.02

DriftOPD:面向一步 VLA 策略的序列级反向 KL 蒸馏

DriftOPD 是一个免教师、免 rollout 的框架,用于对连续 VLA 动作专家做序列级 on-policy 蒸馏。作者将序列级反向 KL 散度分解为 chunk 级反向 KL 项与刻画当前动作长时程影响的未来势能项,分别用一步 drifting 目标和从离线示范学习的 Q 函数评论家优化,从而仅靠离线数据和一步动作生成实现序列级优化。

05

灵巧操作与触觉感知

本版导读灵巧操作与触觉感知方向覆盖遥操作、抓取生成与视触觉表征。DITTO-X 提出手部无关的灵巧遥操作接口,利用机器人手部已有传感渲染关节级力与指尖接触事件,可驱动 Sharpa、Wuji、Inspire 三款商用灵巧手而无需逐手重新设计。FunCo-Grasp 通过功能部件对齐与规范坐标系对齐建立跨本体功能对应,在留出物体仿真中三只已见手平均成功率 92.40%,四只未见手 74.02%。OccluDex 提出分层三维视触觉表征学习框架,结合全局几何与局部接触信息应对自遮挡。TacDyn-WAM 则预测隐式触觉动力学而非重建未来触觉观测。

arXiv cs.RO10.01

FunCo-Grasp:面向跨本体灵巧抓取生成的功能对应方法

FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。

arXiv cs.RO10.01

OccluDex:面向自遮挡下第一视角灵巧操作的分层三维视触觉表征学习

OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。

往期 AI 周报
(本期完)

具身雷达 周报由编辑系统根据公开来源自动综合,每条均附原文 · 往期周报