AI 日报 · 2026 年 10 月 2 日 · 星期五
具身雷达
EmbodiRSI 递归自改进系统提升机器人真机适配效率
EmbodiRSI 在真实到仿真再回真实的流程中做递归自改进,用任务专属仿真低成本迭代策略后再迁回真机,两轮更新后自主仿真成功率从 50.4% 提升。同日还有 SimEX 自动研究框架、Fiatlux 人形爬梯换灯泡长时程基准、BIND 动作表示等多项进展。
论文研究
EmbodiRSI:面向数据高效机器人适配的递归自改进系统
EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。
SimEX:仿真集成的机器人自动研究框架
SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。
Fiatlux:面向人形机器人爬梯与换灯泡的长时程基准
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
BIND:将 3D 机器人动作绑定到 2D 图像特征的动作表示
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
Galbot 团队系统评测 GPT-6 Astra 作为具身策略的能力
Galbot 团队在六个领域系统评测 GPT-6 Astra 作为通用具身策略的表现,涵盖直接控制、与学习策略协作和反馈驱动适应。
DrivingBench:视觉语言模型能否驾驶丰田卡罗拉
研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。
URAI:让前沿智能体编写、调用并演化机器人工具
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
DTMR:面向腿足机器人的稠密时序动作重定向
作者提出稠密时序动作重定向(DTMR),在单个优化中联合优化时序与控制,对每个控制步调整时序,并用基于采样的 MPC 在 GPU 上并行求解。在四款人形机器人、两小时人体动作数据上评测,DTMR 优于基线,尤其在跳跃等动态动作上;相同形变预算下比优化时间维度的基线重定向更精确且快约 19 倍。用其参考动作训练的策略已迁移到真实人形机器人。
快讯
- TALK-Dem:面向痴呆症沟通模式的具身任务规划基准arXiv cs.RO
- L1-MPPI:面向敏捷无人机控制的 L1 自适应模型预测路径积分arXiv cs.RO
- Memorize, Adapt, Ignore:诊断训练数据变化下的机器人学习机制arXiv cs.RO
- Yggdrasil:面向实时查询的分层优先3D场景图arXiv cs.RO
- TRACE:自遮挡密集杂乱场景下计划条件模仿的鲁棒取物arXiv cs.RO
- PneuTac:用统一 MPM-高斯泼溅仿真实现软体气动机器人触觉操作arXiv cs.RO
- 基于运动策略的人形机器人足球:多方向踢球技能库的任务门控强化学习arXiv cs.RO
- Cue the Flow:用空间线索引导流匹配策略完成开放世界配送操作arXiv cs.RO
- PRICE:面向具身强化学习的物理关系信用分配方法arXiv cs.RO
- CEER2:面向人形机器人移动操作的方向可调末端执行器与根部柔顺框架arXiv cs.RO
- Online-ES:通过自监督轨迹分布优化在线进化 Flow Matching VLA 策略arXiv cs.RO
- HIDE 基准与 SEEK 框架:面向部分可观测机器人操作的技能级记忆评测与增强arXiv cs.RO