Persona 押注人形机器人进船厂做焊接
Persona AI 将人形机器人的首个商业方向定为船厂焊接,使用手持工具完成长直焊缝,已与 HD Hyundai 和 POSCO 建立公开合作。公司认为船厂存在熟练焊工短缺,焊接速度受金属熔化限制约为每秒一厘米,且以毫米级重复动作为主,适合机器人长时间作业。Persona 称其目标是帮助客户扩大造船产能而非替代人工,并计划从焊接扩展到打磨、喷涂等相邻工序。
Persona AI 将人形机器人的首个商业方向定为船厂焊接,使用手持工具完成长直焊缝,已与 HD Hyundai 和 POSCO 建立公开合作。公司认为船厂存在熟练焊工短缺,焊接速度受金属熔化限制约为每秒一厘米,且以毫米级重复动作为主,适合机器人长时间作业。Persona 称其目标是帮助客户扩大造船产能而非替代人工,并计划从焊接扩展到打磨、喷涂等相邻工序。
香港大学与超维动力KAI研究团队组成的港大超维战队,用两台人形机器人按11分制自主打完一局乒乓球,全程无遥控、无人喂球,比赛将在8月22日至26日于国家速滑馆举行的第二届世界人形机器人运动会上亮相。
IEEE Spectrum 的 Video Friday 汇总了 DARPA Lift 挑战赛最后几天的视频回顾,重点收录了挑战中机器人失败、坠毁乃至电池起火的画面。同批视频还包括 Monumental 机器人砌筑约 20,000 块砖、STEMbot 沿植物茎秆攀爬查虫,以及 DEEP Robotics DR02 人形机器人稳定上下楼梯。
德塔智能与舞肌科技签署战略合作协议,将围绕全身协同灵巧操作的数据采集与模型训练展开协同,打通“数据采集—模型训练—灵巧操作”全链路。双方计划于年内推出联合定义的“全身协同灵巧操作数据标准”与“模型训练基线”,并以舞肌科技轻量化数据手套为核心采集终端、直驱灵巧手适配德塔智能基础模型,完成从采集、训练到端侧部署的链路验证。
加拿大 Hamilton(安大略省)一个付费 4–6 周的原型项目正在招聘机器人工程师,目标是搭建家用操作(household manipulation)原型,采用混合办公。该岗位由需求方直接发布,具体技术栈、本体与交付指标未在正文中披露。
德国卡尔斯鲁厄理工学院(KIT)设计出一套机器人拆解系统,可依据破损产品的 CAD 模型预测故障并拆解,同时保护关键零件不受损伤。系统通过数学建模判断零件自由度异常,并在拆解过程中持续校验、必要时改用铣削等方式,还可指定需完整保留的零件。该研究已在 ICRA 2026 发布,团队设想将其扩展为多机械臂协同的自动化拆解工厂。
新加坡南洋理工大学团队研发出长 4.4 毫米的种子大小磁控机器人,可在弱磁场控制下无线完成移动、切割组织、释放药物、抓取并储存组织样本、产热五种功能,功能切换不到一秒,成果发表于 Advanced Materials。
MIT CSAIL 与丰田研究院提出 SceneSmith,用设计师、评论者、编排者三个基于 GPT-5.2 的 VLM 智能体协作生成可直接载入物理仿真软件的 3D 室内场景,单场景物体数量最多为先前方法的六倍。
Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。
推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。
BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。
推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。
Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
Toyota Research Institute 分拆公司 Walden Robotics 于 7 月 15 日结束隐身状态,获得 3 亿美元融资,估值 11 亿美元。
EPFL、杜克大学和里斯本高等技术学院团队在 Science Robotics 发表研究,用物理仿真 simZFish 和 80 厘米、2.7 公斤的机器鱼 ZBot 复现斑马鱼视觉运动反应(OMR)神经回路。
梅卡曼德机器人在 WAIC 2026 展示同一套“眼脑手”组件驱动的人形机器人与机械臂作业,覆盖工件上下料、料筐搬运、线束插头柔性抓取与精密装配、五角螺母抓取,以及零售和家庭场景中的物体分类与透明物体分拣。
Gritt 结束隐身状态,宣布完成由 Obvious Ventures 领投的 2600 万美元 A 轮融资,累计融资 3200 万美元。该公司由两位卡内基梅隆背景的机器人专家创立,不自建机器人本体,而是用 Kawasaki 机械臂等现成硬件搭配自家 AI 模型,首个任务是卸载并定位大型玻璃太阳能板,精度达亚毫米级。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。
推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。
光鉴科技发布具身智能视觉感知方案,以AI双目视觉为核心,并推出Libra系列AI双目视觉模组:Libra 1000采用2cm基线面向腕部精细操作,Libra 3000采用7cm基线面向中远距离空间感知。方案采用全域泛化感知设计,以统一硬件平台支撑深度感知、SLAM定位、目标检测等任务并支持OTA升级,同时通过优化计算架构降低算力占用,为VLA推理等释放算力。
苏度科技在 WAIC 首次国内大型展会亮相,展示精密装配、柔性打包、移动操作和与宁德时代合作的电池模组产线四组 Demo,四台同型号机器人分守不同工位协同完成上料、电芯装配、扫码、下料全流程。
魔法原子在 2026 世界人工智能大会(WAIC)期间展示自研通用具身大模型 Magic-VLA K02,现场完成叠盒封胶、柔性衣物整理和行李箱收纳等长程任务,其中叠盒封胶组合式长程任务成功率超过 90%。
一名海洋机器人新手在寻找用于水下视觉引导操作的仿真器时遇到两难:DAVE 的相机话题输出 RGB 图像过于干净,而 StoneFish 的画面更逼真,但其 ROV/AUV 不带机械臂。该用户希望获得兼顾逼真渲染与机械臂支持的水下操作仿真方案建议。
梅卡曼德在WAIC 2026展示由3D视觉系统、Mech-GPT多模态大模型和Mech-Hand灵巧手组成的眼脑手组件,覆盖人形机器人上下料、线束装配、五角螺母抓取及透明物体分拣等场景。其中五角螺母抓取单件用时不到2.4秒,线束插接精度达亚毫米级。公司称其产品已在工业场景大规模落地,全球累计部署27000余台,服务100余家《财富》500强客户。
优理奇机器人(UniX AI)联合浙江大学、MIT、牛津、耶鲁、上海交大发布 UniTac,提出统一的跨传感器触觉理解与生成架构,并接入 VLA,该工作已被 ECCV 2026 接收。
Agility Robotics 在加州弗里蒙特开设 6 万平方英尺设施,用于训练其人形机器人 Digit,选址靠近特斯拉预计今年开始生产 Optimus 的工厂。
德州农工大学博士生 Sarah Downs 为 NASA 与美国空军合作项目开发了一种不依赖视觉系统的力反馈插入算法,让太空装配卫星的机械臂完成天线插入的“轴孔装配”任务。该机械臂通过夹爪上的力矩传感器感知力反馈,在零重力下完成插入并保持位置,还需计算反向推力以抵消机械臂运动对卫星的反作用力矩。
UC San Diego 提出基于人形机器人的腹腔镜遥操作框架,使用通用器械,通过台架测试、不同手术经验水平的干实验室用户研究以及活体猪实验,量化其技术可行性、任务表现与临床就绪度。研究称这提供了人形机器人手术应用能力与局限的循证评估,并指出临床部署前仍需解决关键技术挑战。
这篇教程演示如何编写 OpenClaw Skill,通过 hands_ctrl.py 脚本控制 AgileX NERO 机械臂完成握手、挥手和恢复三类动作。Skill 将自然语言指令映射为 `--action shake/wave/recove` 参数调用同一后端脚本,并在新动作前用 Ctrl+C(SIGINT)中断正在执行的进程以避免电机冲突。
EPFL 与 MIT 工程师受潜水鸟类启发,设计出重量不足 300 克的扑翼式水空两栖飞行器 FAAV,可在水下游泳并拍翅跃出水面继续飞行,相关成果发表于 Science。
一种名为 Electrofluidic Fiber Muscles 的新型执行器利用电液压力驱动长管中的压力梯度,使肌肉束收缩,可分别连接执行回路的伸肌与屈肌部分,类似生物机械系统。其驱动压力泵可绕纤维本身布置,形成紧凑结构。该执行器距进入爱好者机器人应用可能还需一段时间。
小米技术官方微博发布小米机器人进厂实习进展,本季度新解锁中控台侧盖板排序和料箱折叠回收两个工站,成功率均达90%以上并实现连续长时作业,此前自攻螺母工站成功率做到98%。
通用人形机器人公司逐际动力宣布完成2亿美元Pre-IPO轮融资,投后估值150亿元,海外资本占本轮融资额70%,过去半年累计融资4亿美元。资金将用于大小脑融合技术产品化、数千台全自主人形机器人批量落地交付及全球市场渠道建设。创始人张巍表示过往融资均未设置营收、交付规模业绩对赌,并首次拆解系统0、系统1、系统2三层大脑架构,主张对世界模型去魅。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
两支全尺寸人形机器人队伍首次在硬件上完成 11 对 11 足球比赛,RoboCup 称这是机器人领域长期愿景的一次落地。1X 发布为 NEO 平台打造的 25 自由度机器人手,采用腱驱动、触觉传感与内置柔顺,可实现灵巧操作与精细工具使用。
RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。
推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。