OccluDex:面向自遮挡下第一视角灵巧操作的分层三维视触觉表征学习
OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。
推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。
OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。
推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。
FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。
推荐理由:论文提出跨本体灵巧抓取的功能对应方法,读者可了解无需目标手抓取数据即可迁移到未见手的思路与仿真真机结果。
IEEE Spectrum 的 Video Friday 本周收录了 The Robot Works 的小鹅机器人 Goose。Skydio 推出固定翼无人机 F10,用机械臂自主发射与回收;宇树 19 台人形机器人在 9 月 22 日上海世界技能大赛开幕式上与 120 名舞者同台,完成全程 AI 驱动的自主集群表演。ULOHA 将 LeRobot 扩展到双臂水下遥操作与自主操作。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
自变量发布全新灵巧操作系统 TwinDEX,在后训练阶段真机遥操数据为 0 的情况下,用几百条无本体数据完成化学实验场景中的旋拧瓶盖、注射器推注等精细操作。该系统由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程组成,采用三指九自由度和数采与执行同构设计,官方称单位时间有效轨迹约为传统真机遥操的 5.3 倍。
量子位刊载的触觉传感技术路线分析首篇认为,视触觉传感器(VBTS)底层仍依赖小体积CMOS摄像头模组成像,算法多复用ResNet/CNN、U-Net、光流法等视觉工具,硬件门槛低、同质化严重,难以形成技术护城河。
超维动力在2026世界机器人大会现场展示全栈具身智能系统,包括全尺寸人形机器人KAI Bot、37自由度灵巧手KAI Hand、数采头环KAI Halo、KAI World Model与KAI Embodied AI Infra。
量子位梳理发现,至少十六位香港高校教授以创始人、联合创始人或首席科学家身份参与具身智能创业,方向覆盖世界模型、具身大脑、触觉灵巧手、手术机器人、无人叉车、无人机与自动驾驶。港大马毅联合创立忆生科技做自主学习世界模型,港科大王煜联合创办的戴盟机器人每平方厘米排布4万个感知单元,港大罗平参与的超维动力做117自由度人形机器人。港中大(深圳)贾奎的具身智能引擎公司估值已达百亿并冲刺上市。
GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。
推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。
CoToGrasp 是一个以特定接触拓扑为条件生成多样稳定抓取的生成框架,采用与物体无关、以夹爪为中心的工作空间实现零样本泛化。该方法完全在物体无关的方式下训练,通过特征化规范工作空间将局部物体特征投影到统一的夹爪中心域,解耦语义功能意图与物体几何。
章鱼动力(SynapX)在2026世界机器人大会发布“脑-手-数据”技术体系,包括SYNWorld具身原生世界基础模型、OctoH-Hand高自由度仿生灵巧手和OctoSense下一代具身数采方案。OctoSense称全球首次实现肌电跨个体零样本泛化,让人类操作数据近乎无损对齐真机。公司三个月内获近10亿元融资,投资方包括地平线、高瓴创投、小米战投等。
超维动力在2026世界机器人大会展出SMASH 2.0高动态人形乒乓系统、KAI世界模型、117个全身自由度的KAIBot、37个自由度的KAI Hand灵巧手与KAI Halo第一视角数采头环。
德塔智能与舞肌科技签署战略合作协议,将围绕全身协同灵巧操作的数据采集与模型训练展开协同,打通“数据采集—模型训练—灵巧操作”全链路。双方计划于年内推出联合定义的“全身协同灵巧操作数据标准”与“模型训练基线”,并以舞肌科技轻量化数据手套为核心采集终端、直驱灵巧手适配德塔智能基础模型,完成从采集、训练到端侧部署的链路验证。
戴盟机器人宣布完成数亿元战略轮融资,由蚂蚁集团领投,老股东超额跟投,并发布全球首个触觉锚定世界模型 Daimon-TWM。该模型参数规模达 10B 级,可在 NVIDIA RTX 5090 平台实时推理,以物理认知、推演决策、瞬时操控三层架构实现 100Hz 高频伺服纠偏,官方称无扰动条件下接触密集型任务平均成功率较 π0.5 提升两倍、有扰动条件下提升达十倍。
量子位统计,今年上半年灵巧手相关企业融资额超200亿,其中10家以灵巧手为主业的公司新增融资近80亿元、投后估值合计超750亿元,灵心巧手6月传出估值60亿美元。
DARPA Lift Challenge 本周末举行,多款外形奇特的重型起重无人机设计亮相,DARPA 已录制全程直播。NASA SkyFall 火星直升机将用地面穿透雷达搜寻冰冻水,为此搭载可向下伸展的柔性织物天线,避免干扰着陆或在触地时损坏。Generalist 称 GEN-1 在适应新执行器与新机器人方面改进,内部基准提升 10-20 倍,在 NIST 板拆解等高精度任务上表现显著提升。
伦敦玛丽女王大学等欧洲团队研发了一种机器人指尖,其合成皮肤通过布拉格反射器在受力变形时反射不同波长光,由内置摄像头读取颜色变化,生成拓扑、应变和接触压力图。该指尖实现100微米分辨率且无计算延迟,已用于生成人类指尖、硬币和叶片的形貌图。研究者称下一步希望提升对非平面物体的感知能力,并已与潜在应用企业接触。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
梅卡曼德机器人在 WAIC 2026 展示同一套“眼脑手”组件驱动的人形机器人与机械臂作业,覆盖工件上下料、料筐搬运、线束插头柔性抓取与精密装配、五角螺母抓取,以及零售和家庭场景中的物体分类与透明物体分拣。
梅卡曼德在WAIC 2026展示由3D视觉系统、Mech-GPT多模态大模型和Mech-Hand灵巧手组成的眼脑手组件,覆盖人形机器人上下料、线束装配、五角螺母抓取及透明物体分拣等场景。其中五角螺母抓取单件用时不到2.4秒,线束插接精度达亚毫米级。公司称其产品已在工业场景大规模落地,全球累计部署27000余台,服务100余家《财富》500强客户。
中兴通讯在 WAIC 上发布 OEX 正交架构超节点,单柜支持 128 个 GPU、可扩展至 1.6 万卡规模,并联合曦智科技、壁仞科技、沐曦股份、燧原科技、天数智芯等厂商叠加 dOCS 架构推出 Matrix 超节点方案,连续第二年拿下 SAIL 奖。同期还首次公开亮相全球首款 AI 智能体手机努比亚 NaviX Ultra,并展出中兴星仔、中兴星擎、中兴星旺三款人形机器人。
MIT 工程师设计了一款超声腕带,通过对手腕肌肉、肌腱和韧带成像,配合 AI 算法实时翻译出五指和手掌的位置,从而无线控制机械手。研究团队用 8 名不同手型和腕围的志愿者测试,腕带能追踪包括美国手语 26 个字母在内的手势和抓握动作;演示中佩戴者操控机械手弹琴、投桌面篮球,并在屏幕上缩放和移动虚拟物体。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
Genesis 发布 v1.2.2,新增面向强化学习灵巧策略训练的高吞吐真实触觉传感器系列,并支持迟滞、失效触觉单元、探针增益等噪声选项。非凸碰撞检测鲁棒性提升,性能与凸分解相当,修复了虚假深层接触与薄壳穿透问题;启用 noslip 后处理对所有后端的减速降至 20% 以内。
6月30日,联想控股微空间、联想之星和融科资讯中心发起的“科技有「联想」”沙龙首场活动“硅基进化论”在京举行,8位具身智能嘉宾围绕数据基础设施、模型范式与量产商业化展开讨论。智在无界称其4月发布的Being—H0.7将数据扩展至20万小时人类视频,并采用隐式世界模型路线;优宝特正从百台级迈向千台级交付。
2026 年 6 月 1 日至 5 日在维也纳 Messe Wien 举行的 ICRA 2026 上,机器手成为今年最大趋势,灵巧度显著提升。Direct Drive 的 D1-modular 机器人可分成两半,能跳跃、扭转并穿越复杂地形;Tesollo 人形机器人用长臂抓取水果放入篮子。ARIA 的 Jenny Read 介绍了英国 Smarter Robot Bodies 项目的资助提案。