论文提出具身操作数据金字塔,梳理五类数据来源与数据配方
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
以色列研究实验室 Enigma 完成 7100 万美元种子轮融资,由 Index Ventures 和 Ribbit Capital 领投,Conviction Partners 的 Sarah Guo 参投。
针对 ROS/ROS2 感知管线现场调试难题,原型 YERP(YOLO Edge Runtime Profiler)提出在 rosbag2 snapshot 之上加一层事件触发的运行时证据层,由 YERP 判断何时触发快照并记录触发原因与结构化感知运行时证据。
超维动力与北大医疗达成合作,围绕具身智能在医疗场景中的数据采集、世界模型与仿真训练展开联合创新,构建从拟真训练到场景验证再到医院应用的落地路径。超维动力提供KAI World Model世界模型引擎、KAI Halo第一人称数据采集头环及KAI Embodied AI Infra等技术底座,北大医疗提供临床场景与医疗经验。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
Encord 在加州 San Leandro 仓库试验用 Zander Labs 的脑电波头显采集机器人训练数据,通过测量错误、意图和惊讶等心理状态为数据集打标签。
开源 ROS 2 文本转语音插件 gz_ros_tts 发布,面向最新 Gazebo Harmonic,支持 ROS 2 Humble 与 Jazzy,并已在 Heinz H1 人形机器人上测试通过。该插件延续 Gazebo Classic 版本的思路,将 TTS 支持带入现代 Gazebo 生态。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
康奈尔 Tech 团队提出一种光接收器,用类似二维码的光矩阵产生的光电流直接翻转 SRAM 中的二进制值,省去把光信号转成电信号的高功耗模拟电路。该设计在上月于檀香山举行的 IEEE/JSAP VLSI 技术与电路研讨会上展示,实验室原型目前只能通过金属掩模发出静态 14×14 位矩阵,团队正与光学研究组合作开发每秒可切换数百万次、传输每秒吉比特级的光发射器。
上海新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,数据与模型均开源。
推荐理由:三份报告分别给出触觉数据底座、VLA 触觉预判和世界模型触觉预测,可对照看触觉如何接入现有技术路线。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
作者发布 roschema 工具,用于在 CI 阶段检测 ROS 2 接口(msg/action/srv)定义的破坏性变更,避免其到运行时才暴露。它可将接口定义与 git ref、目录、MCAP bag 或 lockfile 做 diff,并按 wire、source、introspection、behavior 分类每条变更,配有稳定规则 ID 可配置或抑制。
QERRA-v2 Classical 作为道德边界执行守卫,在 Webots R2025a 中用 PAL Robotics TIAGo 以 AMR 身份完成三阶段仓库走廊仿真。
IEEE Spectrum 刊出一首以火星车 Curiosity 第一人称写成的诗,讲述它几乎已忘记雨,并知道自己再也不会见到雨。诗中描述这片土地没有树叶、叶状体或刺,植物若存在也低矮伏地、被尘土掩藏,尘埃细如流体、更像雾而非天空。它说若机器也会思念地球,那它便是如此。
RSS 2026 上,Physical Intelligence 相关研究者称包括 PI 在内的北美头部具身智能公司离成熟都还有不短距离,整个领域尚未出现奠基性工作,并质疑中国公司自称"中国版XX"。多位研究者认为 VLA 与世界模型并不冲突,π0.7 已含世界模型组件;数据筛选与配比(curation)比单纯堆量更关键,Simar Kareer 建议参照 π0 的 1 万小时训练规模。
科沃斯将旗下具身智能机器人八界整体开源,并在苏州挂牌成立八界开源智创空间,面向开发者、高校师生和科研人员免费开放平台使用权限。八界采用六自由度机械臂、臂展800毫米、静音移动底盘与44厘米升降机身,搭载两颗双RK3588融合SoC,可在本地带动7B参数大模型。
Polka v0.5.0 发布,这是一个在 ROS 2 中统一处理 2D/3D 激光雷达数据的节点,支持点云合并、传感器同步/丢帧标记、滤波、完整 QoS 控制以及单雷达加 IMU、多源加 IMU、运动关节上传感器的去畸变。
ROS Discourse 上讨论 package.xml 的 license 标签是否应改用 SPDX 标识符,并建议更新 REP 149。rkent 指出该字段被 rosdoc2 和 rosindex 用于文档页展示,rosindex 只取第一个 license 标签文本,rosdoc2 会拼接多个标签并读取根目录 license.* 文件。
高中生作者在 ROS 2 Jazzy 发行版中发布 scan_detection_fusion,将 2D LiDAR 扫描与相机目标检测融合,输出带语义标签的距离化障碍物和类别感知地面轮廓供导航使用。
Pavlov Mini Wheel 系列第 2 部分解析了这台 ROS 2 自主机器人从单帧相机图像到导航目标的完整感知流水线,系统由多个独立 ROS 2 节点组成。
ROS 发布本周动态:Nav2 团队发布不同计算平台在仿真导航基准上的性能对比,ROS 基础设施团队上线 Buildfarm 仪表盘,集中展示 ROS 与 Gazebo 包的构建和测试失败情况。此外还有 25kg 负载六足机器人、基于 TensorRT 加速的 Fast-FoundationStereo 立体深度估计 ROS 2 Jazzy 工作空间,以及 ROSCon 多站活动日程。
一名安全工程师在 ROS Discourse 询问,已投产的仓库/3PL AMR 车队是否在运行时持续做安全监控,还是仍以 SROS 2、DDS security 等设计期加固为主、上线后不再干预。他还追问机器人被入侵的担忧被归为网络安全问题还是安全/可用性问题,以及内部由谁负责。OSRA 回应称即将启动改善 ROS 安全性的工作,并邀请其提供经验与问题。
IEEE Spectrum 的 Video Friday 汇总了本周机器人视频:Generative Bionics 用六个月把 GENE.01 做成可行走、可感知和交互的人形平台,其全身多模态皮肤可感知触觉、接近、力与温度。Generalist 的具身基础模型 GEN-1 支持从五指手到专用工具的多种末端执行器,通过跨数千种接口的预训练获得可迁移的物理常识。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
ROS 社区开发者 Panav 正为其维护的库添加 ROCm 支持,以便在 AMD 设备上运行,但缺少 AMD 硬件用于边缘端测试。Open Robotics 的 Kat 表示 AMD 有意支持此类开源开发,可帮忙对接相关团队;smac 则建议先购买 AMD Halo 或 GMKTec EVO-X2 进行移植和初步测试,两者与新款 AMD Kria AI Robotics 采用相同 SOC。
巴塞尔大学团队研发出名为 MIR(Miniature Intraoral Robot)的微型口腔机器人原型,尺寸仅 43×26×28 毫米,用于按数字化方案精准预备牙冠。在合成树脂与类牙釉质陶瓷材料测试中,其位置误差低于 0.2 毫米,钻削力保持在 5 牛顿以下,目前尚无传感器直接测量或校正位置。研究团队下一步计划集成传感器与摄像头,使系统能实时监控位置和治疗进度,且不增大机器人尺寸。
量子位不完全统计97家国内具身数据玩家,其中70家做数据采集、27家做数据infra,过去一年15家独立具身数据服务商共完成34起融资、合计约44.7亿元。行业现有年产能为160万至180万小时加7000万至8000万条,短期目标为未来1至3年产出2500万至3500万小时加亿条级数据。玩家中独立数据服务商39家占40%,为最大群体,但15家中13家最新轮次在A轮及以前,没有一家披露过利润。
7月19日WAIC“世界模型六小龙”论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人六家技术负责人就技术路线展开讨论,形成像素生成、隐空间(JEPA)与融合三派。
梅卡曼德机器人在 WAIC 2026 展示同一套“眼脑手”组件驱动的人形机器人与机械臂作业,覆盖工件上下料、料筐搬运、线束插头柔性抓取与精密装配、五角螺母抓取,以及零售和家庭场景中的物体分类与透明物体分拣。
佐治亚理工助理教授Danfei Xu发起第一视角人类操作数据生态EgoVerse,公开版本含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者,联盟伙伴包括佐治亚理工、斯坦福、苏黎世联邦理工、UC San Diego以及Meta、Scale AI、光轮智能等公司。
2026 ROS 暑期学校杭州站结束七天课程,23 个平行专题覆盖 ROS2 开发、TF2、SLAM 与自主导航、MoveIt2 机械臂运动规划、仿真及 ROS-I 工业标准,学员来自 300 多家国内外机构、超过 700 人。
Mobileye 创始人兼 CEO Amnon Shashua 计划在执掌近三十年后卸任,公司将在找到继任者前由其继续担任 CEO,这一变动发生在公司推进 robotaxi 与人形机器人业务之际。
IIT Bombay 火星车队二年级学生 Panav 发布 ros2vine,可从自然语言描述生成完整、可直接 colcon build 的 ROS 2 包,支持 Python(rclpy)与 C++(rclcpp)或混合,并带静态校验器检查缺失依赖、错误入口和导入。
Nav2 作者 Steve Macenski 开源了一套机器人工作负载基准,用完整自主栈运行叉车抓取放置任务,而非孤立的合成微基准。该基准处理来自 3D LIDAR、深度相机等的 9 路传感器流,在 180,000 平方英尺仓库中运行完整自主栈并叠加较重的 VLM 负载,已对 AMD Strix Halo、NVIDIA Jetson Thor 和 Orin AGX 进行测试。
一位开发者正考虑开源其过去几个月构建的工具核心,用一条终端命令把 CAD 装配体转换为 URDF,无需 CAD 插件即可直接在 ROS 中使用。他发帖征集意见:是否会使用这类免费 CLI 工具,还是更倾向现有 CAD 插件,以及不用的最大原因是什么。
特斯拉公布的图表显示,其 Robotaxi 网络第二季度为付费乘客行驶的里程较第一季度下降约36%,从约110万英里降至约70万英里,尽管运营已扩展至得州和佛州的六座城市。
云机器人工作组(CRWG)将于 2026-08-24 16:00–17:00 UTC 召开下次会议,继续编辑 Logging and Observability 指南初稿。
北京市发展改革委会同市委网信办、市科委中关村管委会、市经济和信息化局联合印发《北京市关于加快智能体引领发展的若干措施》,提出九项具体举措。政策聚焦基础模型能力、智能体底层共性技术、原生应用与标杆场景、智能终端融合、OPC创新创业模式、Token经济、安全治理、要素保障和开源开放等关键领域,并探索智能体分级分类监管、Token券与智能体服务券等支持方式。
Fast DDS 发布 v2.6.12,修复 18 个 CVE,涉及访问控制解析器和反序列化等模块,相关补丁来自私下审查分支、无公开 PR。