URAI:让前沿智能体编写、调用并演化机器人工具
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。
推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。
FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。
推荐理由:论文提出跨本体灵巧抓取的功能对应方法,读者可了解无需目标手抓取数据即可迁移到未见手的思路与仿真真机结果。
SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。
推荐理由:论文提出仿真与编码智能体结合的自动研究框架,读者可了解无示范条件下获取真机操作技能的两阶段方法。
Video2SwimFish 提出一套自动化流程与基准,从真实鱼的多视角同步视频重建带尺度形变网格,通过 VLM actor-critic 循环生成适配个体形态的内部关节,并从观测到的中线曲率提取 Biological Locomotion Manifold(BLM),作为受真实鱼运动约束的低维动作空间,为每条重建鱼学习个体游动策略。
推荐理由:论文公开了从真实鱼视频重建可控游动资产的数据集与基准,并指出任务成功率与个体运动保真度并不一致。
EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。
推荐理由:论文给出真实到仿真再回真实的递归自改进流程,读者可了解用少量真机轨迹完成策略适配的具体做法。
DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。
推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。
TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。
Galbot 团队在六个领域系统评测 GPT-6 Astra 作为通用具身策略的表现,涵盖直接控制、与学习策略协作和反馈驱动适应。
推荐理由:系统评测 GPT-6 Astra 作为具身策略在六类任务上的表现,并给出成功率与推理延迟数据,可据此判断通用模型与物理控制的差距。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。
推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
斯坦福团队项目 HomeBody 让 GPT-6 Astra 接入宇树 G1,在陌生厨房中按语言指令收拾物品、丢纸盒并从抽屉取药。系统先让 G1 探索建图,再由 Astra 作为 Real2Sim 智能体在 Isaac Sim 中重建数字厨房,之后由 Astra 调用导航、抓取、放置、开抽屉等可复用技能,底层用预训练 AMO 控制策略协调行走与操作。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。
推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。
SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。
推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。
Hugging Face 发布 Sys1Cal-v1 基准数据集,用于直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现,Noul 和 Score 的概率接近真实值,而二元 Choice 输出存在系统性非线性失真,可通过引入潜在第三分量 Uncertain 建模。数据集与评估代码已公开,支持在其他结构化决策模型上复现。
Hugging Face 上公开的论文 EpiCon 提出一种共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用彼此经验。它由两个独立训练的 2B 模型组成:记忆控制器与树状自组织器,分别负责跨尝试精炼文本引导与视觉证据、分层整合经验并检索规则。
Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。
ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。
EPFL 与 NYU 团队在 npj Robotics 发表 ScaFi(Scalable Fish)机器鱼,采用刚性前段加玻纤杆柔性尾部、单电机拉动交叉肌腱产生 S 形摆动,仅需改变尾部杆径即可缩放尺寸。
亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
针对 MiniMax-H3 这类全模态生成模型,一项新评测考察其物理世界推理能力,在 517 个评测实例中整体成功率为 41.97%。其中基于视频的决策推理成功率最高,为 56.00%,基于音频的消歧推理最弱,仅 27.40%。评测设计了隐式提示配多帧、音频-图像、前缀视频和音视频四类任务,要求模型跨模态整合互补信息以推断潜在事件状态与未来动态。
IEEE 已公开 2026 年 ICRA 的主旨演讲、全体会议、行业主题演讲、奖项演讲、教程及六场专题讨论的视频录像。本届 ICRA 于 6 月 1 日至 5 日在维也纳举行,全体演讲嘉宾包括 Ken Goldberg、Barbara Mazzolai 和 Roland Siegwart。
研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
大晓机器人联合南洋理工大学 S-Lab、上海人工智能实验室发布人–场景交互重建研究 HSImul3R,已被 ECCV 2026 接收。
Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。
推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。
澳大利亚昆士兰大学 Biorobotics Lab 研发出半机械蟑螂“Paraborg”,在约 40 克重的巨型穴居蟑螂(Macropanesthia rhinoceros)触角和尾须植入电极,用游戏手柄无线操控其左右转向、前进或停止,并可搭载无线摄像头或弹簧驱动的注射器。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,覆盖行为模仿、状态评估和自然语言解释三个维度。通过潜在状态内化将子智能体的连续表示直接投影为 LLM 的学习状态 token,实验发现相比文本化整合存在持续的"文本化债务",且该差距随模型从 4B 扩展到 14B 参数依然存在。
论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。
推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。
UrbanGround 是一个基于香港全域三维地理数据构建的真实尺度城市副本沙盒,用于测试多模态大语言模型智能体能否在闭环第一人称视角下完成可靠导航与空间推理。
推荐理由:UrbanGround 用香港全域三维数据搭建可闭环交互的城市沙盒,读者可了解 MLLM 智能体在长程城市导航中的能力边界。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
Google DeepMind 发布白皮书《Visual General Intelligence》,探讨以视觉为中心、从图像、视频和几何等模态的学习中能否涌现出通向 AGI 的智能,并将其称为视觉通用智能(VGI)。白皮书由多位不同机构作者共同撰写,目标不是给出视觉智能的唯一定义,而是厘清 AGI 时代计算机视觉应追求的原则、视觉输入模态、基准、学习范式,以及视觉作为核心与语言等其他模态的关系。