跳到正文

#操作/抓取

今日 24 条
8月17日周一
  1. IEEE Spectrum robotics58

    Persona 押注人形机器人进船厂做焊接

    Persona AI 将人形机器人的首个商业方向定为船厂焊接,使用手持工具完成长直焊缝,已与 HD Hyundai 和 POSCO 建立公开合作。公司认为船厂存在熟练焊工短缺,焊接速度受金属熔化限制约为每秒一厘米,且以毫米级重复动作为主,适合机器人长时间作业。Persona 称其目标是帮助客户扩大造船产能而非替代人工,并计划从焊接扩展到打磨、喷涂等相邻工序。

8月15日周六
8月14日周五
  1. qbitai22

    德塔智能与舞肌科技达成战略合作,联合规范全身协同灵巧操作数据采集

    德塔智能与舞肌科技签署战略合作协议,将围绕全身协同灵巧操作的数据采集与模型训练展开协同,打通“数据采集—模型训练—灵巧操作”全链路。双方计划于年内推出联合定义的“全身协同灵巧操作数据标准”与“模型训练基线”,并以舞肌科技轻量化数据手套为核心采集终端、直驱灵巧手适配德塔智能基础模型,完成从采集、训练到端侧部署的链路验证。

8月12日周三
8月11日周二
  1. IEEE Spectrum robotics50

    卡尔斯鲁厄理工学院如何用智能拆解机器人推动循环经济

    德国卡尔斯鲁厄理工学院(KIT)设计出一套机器人拆解系统,可依据破损产品的 CAD 模型预测故障并拆解,同时保护关键零件不受损伤。系统通过数学建模判断零件自由度异常,并在拆解过程中持续校验、必要时改用铣削等方式,还可指定需完整保留的零件。该研究已在 ICRA 2026 发布,团队设想将其扩展为多机械臂协同的自动化拆解工厂。

8月10日周一
8月7日周五
8月6日周四
  1. HF blog71

    Ego2Robot:从第一视角人类视频合成可扩展机器人训练数据

    Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。

    推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。

  2. HF blog62

    BridgeVLA++:面向 3D 操作的数据高效、可泛化、记忆增强 VLA 框架

    BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。

    推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。

8月5日周三
  1. HF blog53

    Push-Wiper:用分段推扫轨迹实现跨污渍与表面的通用机器人清洁

    Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。

8月4日周二
  1. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。

8月3日周一
7月24日周五
7月21日周二
  1. TechCrunch robotics56

    Gritt 结束隐身获 3200 万美元,用机器人安装太阳能板

    Gritt 结束隐身状态,宣布完成由 Obvious Ventures 领投的 2600 万美元 A 轮融资,累计融资 3200 万美元。该公司由两位卡内基梅隆背景的机器人专家创立,不自建机器人本体,而是用 Kawasaki 机械臂等现成硬件搭配自家 AI 模型,首个任务是卸载并定位大型玻璃太阳能板,精度达亚毫米级。

  2. HF blog78

    Pollen Robotics 开源 Grabette:用手持夹爪录制机器人操作数据

    Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。

    推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。

  3. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。

7月20日周一
  1. Robohub82

    交互式世界模拟器:用动作条件视频预测训练与评测机器人策略

    作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。

    推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。

  2. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。

  3. qbitai42

    光鉴科技发布具身智能视觉感知方案,推出 Libra 1000/3000 AI 双目视觉模组

    光鉴科技发布具身智能视觉感知方案,以AI双目视觉为核心,并推出Libra系列AI双目视觉模组:Libra 1000采用2cm基线面向腕部精细操作,Libra 3000采用7cm基线面向中远距离空间感知。方案采用全域泛化感知设计,以统一硬件平台支撑深度感知、SLAM定位、目标检测等任务并支持OTA升级,同时通过优化计算架构降低算力占用,为VLA推理等释放算力。

7月19日周日
7月18日周六
  1. qbitai55

    梅卡曼德在WAIC展示眼脑手组件与Mech-GPT、Mech-Hand

    梅卡曼德在WAIC 2026展示由3D视觉系统、Mech-GPT多模态大模型和Mech-Hand灵巧手组成的眼脑手组件,覆盖人形机器人上下料、线束装配、五角螺母抓取及透明物体分拣等场景。其中五角螺母抓取单件用时不到2.4秒,线束插接精度达亚毫米级。公司称其产品已在工业场景大规模落地,全球累计部署27000余台,服务100余家《财富》500强客户。

  2. IEEE Spectrum robotics22

    德州农工博士生 Sarah Downs 为 NASA 机器人开发卫星装配插入算法

    德州农工大学博士生 Sarah Downs 为 NASA 与美国空军合作项目开发了一种不依赖视觉系统的力反馈插入算法,让太空装配卫星的机械臂完成天线插入的“轴孔装配”任务。该机械臂通过夹爪上的力矩传感器感知力反馈,在零重力下完成插入并保持位置,还需计算反向推力以抵消机械臂运动对卫星的反作用力矩。

  3. IEEE Spectrum robotics40

    你会让人形机器人给你做腹腔镜手术吗?UCSD 系统评估人形机器人手术能力

    UC San Diego 提出基于人形机器人的腹腔镜遥操作框架,使用通用器械,通过台架测试、不同手术经验水平的干实验室用户研究以及活体猪实验,量化其技术可行性、任务表现与临床就绪度。研究称这提供了人形机器人手术应用能力与局限的循证评估,并指出临床部署前仍需解决关键技术挑战。

7月17日周五
  1. ROS Discourse latest30

    用 OpenClaw Skill 控制 AgileX NERO 机械臂

    这篇教程演示如何编写 OpenClaw Skill,通过 hands_ctrl.py 脚本控制 AgileX NERO 机械臂完成握手、挥手和恢复三类动作。Skill 将自然语言指令映射为 `--action shake/wave/recove` 参数调用同一后端脚本,并在新动作前用 Ctrl+C(SIGINT)中断正在执行的进程以避免电机冲突。

7月15日周三
7月14日周二
  1. Hackaday robots32

    Electrofluidic Fiber Muscles:用于人形机器人的电液纤维肌肉执行器

    一种名为 Electrofluidic Fiber Muscles 的新型执行器利用电液压力驱动长管中的压力梯度,使肌肉束收缩,可分别连接执行回路的伸肌与屈肌部分,类似生物机械系统。其驱动压力泵可绕纤维本身布置,形成紧凑结构。该执行器距进入爱好者机器人应用可能还需一段时间。

  2. qbitai62

    逐际动力再融2亿美元筹备港股IPO,张巍称营收对赌不符合具身商业逻辑

    通用人形机器人公司逐际动力宣布完成2亿美元Pre-IPO轮融资,投后估值150亿元,海外资本占本轮融资额70%,过去半年累计融资4亿美元。资金将用于大小脑融合技术产品化、数千台全自主人形机器人批量落地交付及全球市场渠道建设。创始人张巍表示过往融资均未设置营收、交付规模业绩对赌,并首次拆解系统0、系统1、系统2三层大脑架构,主张对世界模型去魅。

7月12日周日
7月11日周六
7月10日周五
  1. HF blog71

    RynnWorld-4D:面向机器人操作的 4D 具身世界模型

    RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。

    推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。

7月8日周三
  1. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。