ROS 2 学习路径架构 v0.1:14 个课程基准测试,零能力模型
对 14 个机器人课程的基准测试显示,没有一个定义能力模型、提供分支进阶或开放式学习者标准参照评估。该 v0.1 讨论稿提出四阶段能力模型(按可观察工作而非课程完成度划分)、以 tf2+URDF 为骨干的技能树,以及五处学习者流失缺口的映射。11 份招聘样本中 10 份要求生产级 ROS 2,8 份要求 C++ 与 Python。
对 14 个机器人课程的基准测试显示,没有一个定义能力模型、提供分支进阶或开放式学习者标准参照评估。该 v0.1 讨论稿提出四阶段能力模型(按可观察工作而非课程完成度划分)、以 tf2+URDF 为骨干的技能树,以及五处学习者流失缺口的映射。11 份招聘样本中 10 份要求生产级 ROS 2,8 份要求 C++ 与 Python。
Gritt 结束隐身状态,宣布完成由 Obvious Ventures 领投的 2600 万美元 A 轮融资,累计融资 3200 万美元。该公司由两位卡内基梅隆背景的机器人专家创立,不自建机器人本体,而是用 Kawasaki 机械臂等现成硬件搭配自家 AI 模型,首个任务是卸载并定位大型玻璃太阳能板,精度达亚毫米级。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。
ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。
推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。
中国河北工业大学的研究团队开发出一款完全无电机的下肢软体外骨骼,由高功率人工肌肉驱动,相关研究7月10日发表于《Science Advances》。在4公里/小时步行测试中,该装置将受试者步行能耗平均降低13.9%,优于多数既往髋部助力外骨骼。
作者提出 Interactive World Simulator,一种动作条件视频预测模型,在像素空间预测后续帧,不含物理引擎,可在单张 RTX 4090 上以 15 FPS 交互运行超过 10 分钟。
推荐理由:作者用同一批策略在仿真与真机上的评分对比,给出世界模型能否替代真机评测与数据采集的一手证据。
论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。
推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。
苏度科技在 WAIC 首次国内大型展会亮相,展示精密装配、柔性打包、移动操作和与宁德时代合作的电池模组产线四组 Demo,四台同型号机器人分守不同工位协同完成上料、电芯装配、扫码、下料全流程。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
上海不筹量子在WAIC 2026发布国内首款原子量子人工智能基座“量筹一号”,量子比特规模突破1500,单量子比特保真度99.9%,里德堡门保真度超99%。该产品采用中性原子QPU、GPU集群与经典CPU的“三算力融合”架构,配套六层全栈软件并开放Q-Cub SDK。其与演逻科技合作将QAOA用于7自由度机械臂逆运动学求解,末端位姿误差小于1毫米、求解时间小于50毫秒、成功率99%。
PyTorch 基金会执行董事柯理怀在 WAIC 论坛上宣布,蚂蚁集团、阿里云、Shopify 正式成为基金会新成员。蚂蚁灵波科技同期发布全栈 2.0 及核心模型 LingBot-VA 2.0,称其为行业首个"具身原生"世界动作模型,面向机器人真实任务从头预训练,可边行动边预测。基于该通用大脑打造的"机器人智慧药房"已入选 WAIC2026"十大镇馆之宝"。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
京东在WAIC首次集体亮相JoyAI全系列大模型、具身数据采集与训练链路,以及以JoyInside为底座的京东AI Home。其开源行业最大人类第一视角数据集EgoLive,含2000小时视频、65866个Episode、覆盖346项真实世界任务,并已发动60万人参与数据采集。接入JoyInside的智能硬件对话轮次平均提升超120%,合作覆盖近200个品牌。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
西门子中国董事长肖松提出,工业AI落地须以具体场景为牵引,破解模型训练与数据供给衔接不足的结构性难题。西门子Smart Detection智能检测平台已在南京、仪征多家工厂部署,硬件成本降低90%,项目交付周期从周级缩短至小时级;其与十五冶合作打造炼铜行业首个下沉到边缘的智能体,使冰铜品位稳定性提升15%。西门子近期还发布Eigen工程智能体,可自主完成PLC编程、HMI可视化、设备配置等任务。
魔法原子在 2026 世界人工智能大会(WAIC)期间展示自研通用具身大模型 Magic-VLA K02,现场完成叠盒封胶、柔性衣物整理和行李箱收纳等长程任务,其中叠盒封胶组合式长程任务成功率超过 90%。
普渡机器人在WAIC首次亮相PUDU D7,并披露自研具身智能大模型PuduFM与具身智能操作系统PuduAgent,共同支撑其「一脑多形」战略。PuduFM由PIM物理预言家、VLA多模态对齐和World Model仿真引擎三部分组成,官方称仅需50条专家示范数据即可完成新任务适配。目前普渡已在全球85个国家和地区部署超13万台机器人,覆盖16个行业。
优理奇机器人(UniX AI)联合浙江大学、MIT、牛津、耶鲁、上海交大发布 UniTac,提出统一的跨传感器触觉理解与生成架构,并接入 VLA,该工作已被 ECCV 2026 接收。
中国电信人工智能研究院(TeleAI)在 WAIC 2026 发布智传网(AI Flow),提出用生成式智能传输把视频编码成 Token 序列,经卫星链路回传后在接收端用生成式模型重建画面。
WAIC 首日,Kimi K3 在模型侧搅动风云,印奇提出 AI 产业下一轮爆发来自智能体模型与下一代终端产品的结合,物理场景通用智能体是第三波核心主线。Richard Sutton 认为静态数据标注已达天花板,经验驱动是下一代 AI 核心路线;苏昊提出解决大模型幻觉的关键是物理智能,需进入真实世界完成端到端交互。
上海推动“AI+制造”,央国企率先在研发端重用大模型,羚数智能“百工”大模型已服务港机、造船巨头并切入超高压变电设备图纸审核。识渊科技AI原生质检方案将电路板换线调机时间缩短至最少55秒,一人可管3条产线。华院计算以“非线性期望的小样本学习算法框架”实现智能配煤,焦炭质量指标预测误差控制在2%以内。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
银河通用发布面向具身智能大模型的测试时后训练框架 WAM-TTT,将 Test-Time Training 迁移至机器人控制,无需重新预训练或人类动作标注,仅用未标注人类 RGB 视频即可在部署阶段适配新场景。
无问芯穹联合清华大学等研发的具身智能强化学习基础设施 RLinf 升级至 v0.3,首次完整打通数据采集、数据管理、SFT、RL、模型评测与真机部署环节,形成从仿真训练到真机在线学习的统一开发闭环。
文远知行内部孵化的景烁科技独立运营,由文远001号员工霍达任CEO,不做整机也不做大脑,专注物理AI的数据与世界模型基础设施。其三层架构为WorldEngine数据闭环、GENESIS-Robotics世界模型和SkillForge技能包,后者已含500K+小时真实交互数据、200+标准化技能包。景烁还自研EGOK采集设备,双目4K@60fps、延迟8ms、整机280g。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
通用人形机器人公司逐际动力宣布完成2亿美元Pre-IPO轮融资,投后估值150亿元,海外资本占本轮融资额70%,过去半年累计融资4亿美元。资金将用于大小脑融合技术产品化、数千台全自主人形机器人批量落地交付及全球市场渠道建设。创始人张巍表示过往融资均未设置营收、交付规模业绩对赌,并首次拆解系统0、系统1、系统2三层大脑架构,主张对世界模型去魅。
Uber 首席产品官 Sachin Kansal 披露,公司正把旅行做成继出行、外卖之后的第三大支柱,酒店预订由 Expedia 提供支持,欧洲的船只租赁则跳转至合作方完成预订。Uber One 会员已达 5100 万,贡献约一半预订量;Uber Eats 近几个季度已独立盈利。此外,成立六个月的 AV Labs 正组建独立于普通司机网络的传感器车队,以采集驾驶数据。
中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。
MIT 工程师设计了一款超声腕带,通过对手腕肌肉、肌腱和韧带成像,配合 AI 算法实时翻译出五指和手掌的位置,从而无线控制机械手。研究团队用 8 名不同手型和腕围的志愿者测试,腕带能追踪包括美国手语 26 个字母在内的手势和抓握动作;演示中佩戴者操控机械手弹琴、投桌面篮球,并在屏幕上缩放和移动虚拟物体。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
量子位不完全统计97家国内具身数据玩家,其中70家做数据采集、27家做数据infra,并总结出十条行业现状。过去一年(2025年7月1日至2026年7月1日),15家不做本体、不做模型、只做数据的独立具身数据服务商共完成34起融资,合计约44.7亿元,其中光轮智能一家融资31亿元、最新估值超20亿美元。
ROS 官方发布 7 月 6 日当周周报,提醒 7 月 12 日是 ROSCon Global 早鸟票最后购买日。本周推荐了可用免费卫星影像和 DEM 数据生成仿真世界的 Gazebo 工具链、支持发送指令且可 pip 安装的机器人数据可视化界面 RUBI,以及支持时序、2D/3D/4D 数据并可通过 AppImage 安装的 PlotJuggler v4.0。
Pika Sense 现支持 AgileX PiPER、PiPER-X、NERO 与 xArm Lite 6 四款机械臂,可结合 Pika Station、Pika Gripper 实现低时延末端执行器遥操作,覆盖单臂与双臂系统。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
作者开源了命令行工具 robot-triage,可对 .bag 或 .mcap 文件自动标记传感器掉线、错误突发、位姿跳变、指令与实际偏差、数值冻结和超范围读数等问题。