AI 日报 · 2026 年 10 月 6 日 · 星期二
具身雷达
OpenRUA:让编码智能体零样本操控机器人
OpenRUA 提出零抽象 harness,仅向现成编码智能体开放 ROS 2 终端访问,把感知重构为文件 I/O、操作重构为编码,由 Claude Opus 5 驱动的 Claude Code 实现零样本视觉运动策略。同日另有 MobiAgent 双环自改进框架、GlanceWAM 稀疏测试时想象等多项具身智能进展。
论文研究
OpenRUA:机器人使用智能体即零样本视觉运动策略
OpenRUA 提出一种零抽象 harness,只给现成编码智能体提供机器人原生软件接口 ROS 2 的终端访问,把感知重构成文件 I/O、把操作重构成编码。使用 Claude Opus 5 驱动的 Claude Code,OpenRUA 在 CaP-Bench 上成功率为 99.0%,在 LIBERO-PRO 上为 87.0%。
MobiAgent:面向长时程移动操作的双环递归策略自改进框架
MobiAgent 是一个双环智能体框架,内环用视觉语言模型做滚动时域规划与视觉反思,动态组合原子技能,外环自动切分并验证部署轨迹、聚类发现技能并持续微调技能库。
GlanceWAM:面向世界动作模型的稀疏测试时想象
GlanceWAM 将视觉想象与动作控制解耦在共享视频 DiT 主干上,异步提议器在后台以慢时钟想象未来单帧,动作头在潜空间以 48 ms 控制频率解码动作块。
Awomo-SimDataEngine:面向机器人训练数据的智能体仿真场景生成系统
PhysicalRSI 团队提出 Awomo-SimDataEngine,一个把资产与场景生成连接到机器人示范合成的智能体系统,包含 ISArt 部件与关节生成、Unravel 图像重建可编辑场景、SimForge 文本生成单房间与多房间环境,以及 PolicyForge 将验证过的世界绑定到任务与机器人本体以产出可回放示范。
SoTa:面向灵巧操作的低成本软触觉皮肤
斯坦福等团队提出 SoTa,一种低成本电容式触觉皮肤,可在人手与机器人手上实现全手覆盖,并在对应手指与手掌区域保持 202 个 taxel 的共享布局。其多层织物电极设计支持自制,每片材料成本低于 10 美元,经 10,000 次加载-卸载循环后仍保留超过 97% 的初始响应范围。
PEWAM:可编程效果到执行的世界动作模型
论文提出 PEWAM,一个 71.5M 参数的世界动作模型,将机器人示范编译为去除演示者的效果程序,即物体 3D 关键点轨迹、抓取点和终止场景配置,并以效果、机器人执行、动作和终止状态四路独立流匹配时间生成。
CriticHack:评估机器人策略优化中的视觉奖励
arXiv 论文 CriticHack 研究视觉奖励模型在机器人策略优化中的失效问题。作者在抽屉任务上对扩散策略的全部去噪参数针对 Robometer 微调,五次训练在 512 个评估种子上把任务成功率提高 10.2 个百分点。
Skill2Real:面向零样本仿真到真机操作的分层技能学习框架
Skill2Real 提出一种智能体策略框架,通过共享 API 学习可执行技能,并用 Proposer-Verifier-Governor 循环借助仿真特权信息诊断结果、验证更新。
快讯
- SimpleTouch:VLA 模型能否不经触觉策略预训练掌握接触密集操作arXiv cs.RO
- EyeRobot 2.0:无需腕部相机的主动注视实现精细操作arXiv cs.RO
- I2CD:从单张图像直接生成仿真可用的凸碰撞几何arXiv cs.RO
- PointWAM:面向灵巧机器人操作的 3D 世界动作建模arXiv cs.RO
- WING:以交互中心频谱隐动作引导从第一人称视频学习机器人策略arXiv cs.RO
- KungfuAthleteBot:从视频学习高动态人形动作并统一实现摔倒恢复arXiv cs.RO
- ProAct:面向 VLA 模型的世界校准提议到动作流框架arXiv cs.RO
- NEEDLE:用已验证局部拼接离线改写机器人数据arXiv cs.RO
- SocialVLA:面向 VLA 操作失败检测与恢复的社会感知网关arXiv cs.RO
- ViGAR:面向组合与上下文机器人操作的分层世界动作模型arXiv cs.RO
- DeltaWorld:面向机器人操作的动作条件交互式世界模拟器arXiv cs.RO
- GeoScaffold:通过重建学习紧凑几何隐变量,实现高效视觉语言导航arXiv cs.RO