URAI:让前沿智能体编写、调用并演化机器人工具
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。
推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。
FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。
推荐理由:论文提出跨本体灵巧抓取的功能对应方法,读者可了解无需目标手抓取数据即可迁移到未见手的思路与仿真真机结果。
SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。
推荐理由:论文提出仿真与编码智能体结合的自动研究框架,读者可了解无示范条件下获取真机操作技能的两阶段方法。
Video2SwimFish 提出一套自动化流程与基准,从真实鱼的多视角同步视频重建带尺度形变网格,通过 VLM actor-critic 循环生成适配个体形态的内部关节,并从观测到的中线曲率提取 Biological Locomotion Manifold(BLM),作为受真实鱼运动约束的低维动作空间,为每条重建鱼学习个体游动策略。
推荐理由:论文公开了从真实鱼视频重建可控游动资产的数据集与基准,并指出任务成功率与个体运动保真度并不一致。
EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。
推荐理由:论文给出真实到仿真再回真实的递归自改进流程,读者可了解用少量真机轨迹完成策略适配的具体做法。
DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。
推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。
TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。
Galbot 团队在六个领域系统评测 GPT-6 Astra 作为通用具身策略的表现,涵盖直接控制、与学习策略协作和反馈驱动适应。
推荐理由:系统评测 GPT-6 Astra 作为具身策略在六类任务上的表现,并给出成功率与推理延迟数据,可据此判断通用模型与物理控制的差距。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。
推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
NVIDIA 在 CES 展示 Caterpillar 座舱内 Cat AI Assistant 原型,基于 Jetson Thor 本地运行 Nemotron 语音模型与 vLLM 服务的 Qwen3 4B,无需云端连接。
Hugging Face 上出现了一个名为 maria715/CAT_adv_eps02_42_relativelr_REFAIT 的模型仓库。该页面未提供模型架构、训练数据、任务类型或性能指标等具体信息,仅包含 Hugging Face 推进开源与开放科学的使命声明。
IEEE RAS 通信委员会会议结束时,IEEE 专家围绕“robotics and automation”这对常用词展开非正式讨论。与会者提出自动化是让流程可重复、高效、可扩展、可预测的过程,机器人则是自动化需要物理存在时才登场,但并非所有机器人都自主,也并非所有自动化都涉及机器人。讨论还指出定义差异会影响机器人吸尘器等产品的国际统计口径与教育中的分类。
斯坦福团队项目 HomeBody 让 GPT-6 Astra 接入宇树 G1,在陌生厨房中按语言指令收拾物品、丢纸盒并从抽屉取药。系统先让 G1 探索建图,再由 Astra 作为 Real2Sim 智能体在 Isaac Sim 中重建数字厨房,之后由 Astra 调用导航、抓取、放置、开抽屉等可复用技能,底层用预训练 AMO 控制策略协调行走与操作。
同一台两轴云台机械臂、同一句"满行程转一遍"的模糊指令下,GPT-6 Astra Pro、Claude Fable 5.1 和 GPT-5.6 Sol 都让机器人转了起来,但对"完成"的理解完全不同。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。
推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。
SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。
推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。
Hugging Face 上出现名为 emmanuel-v/policy_2026-09-30_shake_it_up_on_cart_100kHz_nfft4096 的模型条目,名称包含 100kHz 与 nfft4096 等参数标识。该条目页面未提供更多模型细节,仅附有 Hugging Face 推进人工智能开源与开放科学的使命说明。
Hugging Face 发布 Sys1Cal-v1 基准数据集,用于直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现,Noul 和 Score 的概率接近真实值,而二元 Choice 输出存在系统性非线性失真,可通过引入潜在第三分量 Uncertain 建模。数据集与评估代码已公开,支持在其他结构化决策模型上复现。
Hugging Face 上公开的论文 EpiCon 提出一种共享多模态记忆框架,让不同智能体在不更新宿主模型参数的情况下复用彼此经验。它由两个独立训练的 2B 模型组成:记忆控制器与树状自组织器,分别负责跨尝试精炼文本引导与视觉证据、分层整合经验并检索规则。
Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。
正行创新(Striding AI)联合创始人杨宇欣正式亮相并出任公司总裁,全面负责全球市场拓展、产业生态建设与商业化落地。他此前在黑芝麻智能担任首席市场营销官八年,亲历其首款产品发布、量产到港股上市,更早曾在中科创达任董事及副总裁。正行创新成立于2026年初,由姚颂、正大集团、于超联合发起,通过世界动作模型与强化学习技术推动人形机器人部署至真实商业与工业场景。
消费级具身智能公司诺因智能完成数亿元人民币天使+++轮融资,由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投,成立以来累计融资超10亿元。资金将用于扩充GLOW生成式具身大模型训练数据、推进KNOWIN-X1本体工程验证与量产准备。GLOW在RoboDojo的18项仿真任务中平均成功率62.2%,在LIBERO-Pro以86.7%位列所列单策略模型第一。
AMD宣布以82亿美元全股票收购李飞飞创办的空间智能公司World Labs,交易预计2026年底前完成,仍须取得监管批准。交割后李飞飞将加入AMD担任执行副总裁兼首席科学家,直接向苏姿丰汇报,联合创始人Justin Johnson和Ben Mildenhall继续带领团队并入AMD。
推荐理由:梳理AMD收购World Labs的交易结构、技术合作脉络与各轮投资人回报,可看清芯片巨头布局空间智能的路径。
ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。
截至2026年8月,西门子Xcelerator在中国已积累超66万注册用户、600余家生态伙伴和900余项数字化与低碳化解决方案。平台以共享、共创、共赢拆解生态运转:阿丘科技联合推出AI数智化方案并在西门子成都数字化工厂上线,设序科技获超1000条有效线索、成单超百单,天机智能Gento Luna上架全球Marketplace。西门子西智汇将工业Agent构建周期从约6个月缩短至2~4周。
EPFL 与 NYU 团队在 npj Robotics 发表 ScaFi(Scalable Fish)机器鱼,采用刚性前段加玻纤杆柔性尾部、单电机拉动交叉肌腱产生 S 形摆动,仅需改变尾部杆径即可缩放尺寸。
NASA 喷气推进实验室去年 12 月用 Anthropic 的 Claude 模型协助规划毅力号火星车的两次行驶路线,由人类规划者检查调整后再上传。今年 5 月 NASA 与 IBM 把压缩 AI 模型送上国际空间站和一颗卫星,用于从轨道识别洪水、云层,7 月 ISS 宇航员又测试了大语言模型能否辅助维护程序问答。
ROBOTIS 发布 Mission Canvas,可在地图上定义航点并指定顺序,为每个位置关联一个 Task,使导航与机器人动作作为单个 Mission 执行。
成立三个月的Simate发布首版通用物理快系统Simate-beta,据公司披露以平均Score 33.95、SR 27.96%登顶更新于2026年9月23日的RoboDojo榜单,该成绩属榜单评测,真机表现另行展示。
Hugging Face Datasets 页面更新了一批数据集,小米 MiMo-V2.6-RL-oss 以 7.78k 下载量、47.8k 点赞居前,espnet/yodas3 约 2 小时前更新。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
前华为云大模型CTO李寅与前华为多模态首席科学家张含望联合创办息壤开物,连续完成数亿元种子轮及天使轮融资,估值达5亿美金,由敦鸿资产领投。公司要做Large Physics Model(LPM)大物理模型,先从海量视频、机器人轨迹和真实交互中预训练物理基础模型,再迁移到不同本体和任务。
觅蜂科技9月23日推出觅蜂派,以硬件加App加数据引擎的方式做具身数据众包采集,普通人申领MEgo采集设备后接单采数据并按有效时长获得报酬。觅蜂称MEgo系列已下线2万套,累计采集百万小时有效数据,覆盖22大类场景,内测一个月注册用户2万人、提交1.3万份采集任务。
2026云栖大会具身智能论坛上,行业判断数据时长正失去意义、模型增益才是数据的计价单位,竞争从"找数据"转向"造数据、管数据、用反馈继续生产数据"。阿里云以Qwen参与标注、HappyHorse生成增广数据、DataWorks编排流水线、PAI承接分布式训练,并披露平头哥真武810E芯片在具身智能赛道出货超万片。