AI 日报 · 2026 年 10 月 3 日 · 星期六
具身雷达
λ0:用第一视角人体数据预训练通用人形全身移动操作模型
研究团队提出λ0全身人形视觉语言动作策略,通过三阶段训练先学习第一视角交互数据,再用HumanVerse-500协调身体与手部运动,最后适配下游任务与机器人本体。同日多项工作聚焦VLA的记忆机制与训练效率,包括ECoMEM、Divide-and-Remember与eRLT。
论文研究
λ0:用第一视角人体数据预训练通用人形全身移动操作模型
研究团队提出λ0全身人形视觉语言动作策略,通过三阶段训练先学习第一视角交互数据,再用HumanVerse-500协调身体与手部运动,最后适配下游任务与机器人本体。
ECoMEM:面向记忆依赖机器人控制的显式概念记忆
ECoMEM 提出用可复用的显式概念库表示任务相关历史,由基于证据的 Writer 选择更新记录,再由学习到的 Reader 转成记忆 token 直接条件化 VLA。
Divide-and-Remember:面向长时程 VLA 策略的递归动作相关记忆
论文提出 Divide-and-Remember(D&R)递归记忆方法,用于历史依赖的长时程 VLA 操作任务。该方法从模仿学习的 POMDP 表述出发,将最优记忆定义为在当前观测下最大化动作与记忆条件互信息,并把全历史选择递归拆分为 2K 个 token 中选 top-K 的子问题,所有递归块共享同一选择器。
TacDyn-WAM:在视觉触觉世界动作模型中学习隐式触觉动力学
TacDyn-WAM 是一种异构视觉触觉世界动作模型,预测隐式触觉动力学而非重建未来触觉观测,通过 TacRep 动力学感知触觉目标空间、视觉专家与隐式触觉动力学专家经联合注意力交互,单次前向预测多时间尺度的未来表征及其变化。
Real2Sim2Real 协同训练中的世界与行为对齐研究
该论文提出 real2sim2real 流程,将世界对齐(仿真与真实系统一致)与行为对齐(仿真轨迹与人类运动一致)作为两条独立轴生成协同训练数据。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;平均来看,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
DITTO-X:面向灵巧操作与人工干预的正反向遥操作
DITTO-X 是一种手部无关的灵巧遥操作接口,利用机器人手部已有传感渲染关节级力与指尖接触事件,可驱动 Sharpa、Wuji、Inspire 三款商用灵巧手而无需逐手重新设计。
Kinematic MeanFlow:面向机器人基础模型的一步动作生成策略
论文提出 Kinematic MeanFlow(K-MF),一种面向机器人基础模型(RFM)的一步动作生成策略,用于缓解多步流匹配的高推理延迟。
eRLT:通过动作相关 token 路由实现高效 VLA 强化学习
eRLT 通过路由冻结 VLA 中与任务动作相关的信息来构建状态表示,用学习到的路由 token 聚合多层视觉语言特征,再由轻量层路由器合成固定维度的 RL token,并先用专家示范初始化、再用在线交互的 critic 反馈微调。
快讯
- Recova:面向自主机器人操作的智能体引导失败恢复框架arXiv cs.RO
- 面向 6-DoF 抓取合成的持续学习框架:结合经验与示范arXiv cs.RO
- HumanoidTTT:面向高效人形控制的测试时能力复用框架arXiv cs.RO
- DriftOPD:面向一步 VLA 策略的序列级反向 KL 蒸馏arXiv cs.RO
- 研究提出部分视觉观测下的全身空中抓取与举升方法arXiv cs.RO
- DexPolicy:面向轨迹引导灵巧操作的调度式探索方法arXiv cs.RO
- ScaffoldM3C:面向生成式稳定搭建规划的多模态序列蒙特卡洛框架arXiv cs.RO
- Token-World:在 VLM token 空间为机器人操作建模世界动力学arXiv cs.RO
- Same Scene, Different Task:面向 VLA 组合泛化的技能对齐方法 CRAFTarXiv cs.RO
- 真实到仿真机器人评测中资产与场景重建效果测量arXiv cs.RO
- Reactive Humanoid Multi-Contact Using Learned Stability ModelsarXiv cs.RO
- TOAST:面向自回归视觉语言动作模型的随机动作 token 化方法arXiv cs.RO