LeRobot v0.6.1 发布:lerobot.types 模块更名为 lerobot_types
Hugging Face 的 LeRobot 发布 v0.6.1,将 lerobot.types 模块更名为 lerobot.lerobot_types,属破坏性变更。
Hugging Face 的 LeRobot 发布 v0.6.1,将 lerobot.types 模块更名为 lerobot.lerobot_types,属破坏性变更。
具身智能行业估值逻辑正从为 Demo 可能性付费转向为生产力付费,投资人开始追问机器人每天干几小时活、客户是否续约。上海交通大学杨学以酷哇科技首席科学家身份提出,世界模型分两层,第二层理解并遵守人类社会规则才是最大机会,验证场所只有真实部署现场。酷哇已积累 50PB 城市运行数据、万台级真机部署于全球 50+ 城市及地区,并自研通用具身大模型 COOWAM。
作者在 Ubuntu 24.04 的 apt 安装 ROS 2 Jazzy 上,用 uv 管理工作区级虚拟环境并运行 torch+CUDA 推理节点,记录了五种可复现失败模式。
美国初创 Tau Robotics 在旧金山推出人形机器人清洁服务,每小时 30 美元,旗下 Chelsea、Elon、Tony 三台机器人分别负责厨房卫生间、定期归位和深度清洁。所有演示视频均为遥控操作、一倍速播放,目前采取邀请制。该公司 2024 年成立、团队不到 10 人,2024 年 9 月完成约 300 万美元 Pre-seed 轮。
World Labs于7月21日宣布收购机器人仿真公司SceniX,一周后双方公布Real-to-Sim-to-Real(R2S2R)最新成果,将真实机器人任务搬进仿真、在放大的任务场景中训练和评测策略,再部署回真机,并检验仿真中的相对表现能否预测真机表现。
香港大学 Taku Komura 团队 2016 年发表的《A Deep Learning Framework for Character Motion Synthesis and Editing》获 SIGGRAPH 时间检验奖,该工作首次用深度学习从大规模动作捕捉数据中学习可复用的运动表示。
DeepMind 发布 Gemini Robotics ER 2 具身推理模型,作为机器人的高层大脑负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可据此判断高层推理模型与底层 VLA 的分工方式。
World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。
推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。
一项针对学习示范(LfD)领域为期一年的研究读完 300 余篇论文,发现仅约 20% 可算作高度重要贡献,其余多为对现有方法的渐进改进或新应用领域。研究指出脚本和大语言模型能完成一般性定量评估,却无法判断研究的真正重要性,也识别不出重复已有解决方案的工作或摘要中的夸大表述。作者建议结合人工精读与自动化工具,并让期刊会议评审重新参与论文排序。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
NVIDIA 提出以 GPU 原生医学物理仿真开发医疗机器人,应对医疗机器人无法依赖互联网规模数据采集和无限真实世界实验的问题。每项示范都需要专用设备、临床专业知识和患者或实验室环境的使用权限,由此带来数据缺口等三大挑战。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
悉尼新南威尔士大学(UNSW)研发出全合成软体机器人心脏模型,复现左心内部结构,包含人工瓣膜、乳头肌和腱索,可模拟二尖瓣脱垂与反流等病变。研究发表于 Nature Communications 和 Advanced Science,团队用超声、压力与流量测量验证其行为接近真实心脏,并在该跳动模型内测试了一款软体机器人心脏导管。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。
推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
以色列研究实验室 Enigma 完成 7100 万美元种子轮融资,由 Index Ventures 和 Ribbit Capital 领投,Conviction Partners 的 Sarah Guo 参投。
超维动力与北大医疗达成合作,围绕具身智能在医疗场景中的数据采集、世界模型与仿真训练展开联合创新,构建从拟真训练到场景验证再到医院应用的落地路径。超维动力提供KAI World Model世界模型引擎、KAI Halo第一人称数据采集头环及KAI Embodied AI Infra等技术底座,北大医疗提供临床场景与医疗经验。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
Encord 在加州 San Leandro 仓库试验用 Zander Labs 的脑电波头显采集机器人训练数据,通过测量错误、意图和惊讶等心理状态为数据集打标签。
康奈尔 Tech 团队提出一种光接收器,用类似二维码的光矩阵产生的光电流直接翻转 SRAM 中的二进制值,省去把光信号转成电信号的高功耗模拟电路。该设计在上月于檀香山举行的 IEEE/JSAP VLSI 技术与电路研讨会上展示,实验室原型目前只能通过金属掩模发出静态 14×14 位矩阵,团队正与光学研究组合作开发每秒可切换数百万次、传输每秒吉比特级的光发射器。
上海新智具身智能(NeoteAI)联合复旦大学可信具身智能研究院发布 N0 系列三份技术报告,数据与模型均开源。
推荐理由:三份报告分别给出触觉数据底座、VLA 触觉预判和世界模型触觉预测,可对照看触觉如何接入现有技术路线。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
RSS 2026 上,Physical Intelligence 相关研究者称包括 PI 在内的北美头部具身智能公司离成熟都还有不短距离,整个领域尚未出现奠基性工作,并质疑中国公司自称"中国版XX"。多位研究者认为 VLA 与世界模型并不冲突,π0.7 已含世界模型组件;数据筛选与配比(curation)比单纯堆量更关键,Simar Kareer 建议参照 π0 的 1 万小时训练规模。
IEEE Spectrum 的 Video Friday 汇总了本周机器人视频:Generative Bionics 用六个月把 GENE.01 做成可行走、可感知和交互的人形平台,其全身多模态皮肤可感知触觉、接近、力与温度。Generalist 的具身基础模型 GEN-1 支持从五指手到专用工具的多种末端执行器,通过跨数千种接口的预训练获得可迁移的物理常识。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
量子位不完全统计97家国内具身数据玩家,其中70家做数据采集、27家做数据infra,过去一年15家独立具身数据服务商共完成34起融资、合计约44.7亿元。行业现有年产能为160万至180万小时加7000万至8000万条,短期目标为未来1至3年产出2500万至3500万小时加亿条级数据。玩家中独立数据服务商39家占40%,为最大群体,但15家中13家最新轮次在A轮及以前,没有一家披露过利润。
佐治亚理工助理教授Danfei Xu发起第一视角人类操作数据生态EgoVerse,公开版本含1362小时人类演示数据、约8万个episode、1965项任务、240个场景和2087名采集者,联盟伙伴包括佐治亚理工、斯坦福、苏黎世联邦理工、UC San Diego以及Meta、Scale AI、光轮智能等公司。
2026 ROS 暑期学校杭州站结束七天课程,23 个平行专题覆盖 ROS2 开发、TF2、SLAM 与自主导航、MoveIt2 机械臂运动规划、仿真及 ROS-I 工业标准,学员来自 300 多家国内外机构、超过 700 人。
IIT Bombay 火星车队二年级学生 Panav 发布 ros2vine,可从自然语言描述生成完整、可直接 colcon build 的 ROS 2 包,支持 Python(rclpy)与 C++(rclcpp)或混合,并带静态校验器检查缺失依赖、错误入口和导入。
特斯拉公布的图表显示,其 Robotaxi 网络第二季度为付费乘客行驶的里程较第一季度下降约36%,从约110万英里降至约70万英里,尽管运营已扩展至得州和佛州的六座城市。
北京市发展改革委会同市委网信办、市科委中关村管委会、市经济和信息化局联合印发《北京市关于加快智能体引领发展的若干措施》,提出九项具体举措。政策聚焦基础模型能力、智能体底层共性技术、原生应用与标杆场景、智能终端融合、OPC创新创业模式、Token经济、安全治理、要素保障和开源开放等关键领域,并探索智能体分级分类监管、Token券与智能体服务券等支持方式。
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
优艾智合研发的FabriVLA在Evo-SOTA榜单的Meta-World MT50基准中以90.0%的tier-average成功率登顶第一,超过包括π0在内的国际模型,参数规模为1B级。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
NVIDIA 开源 Medical Physics Simulation 框架,作为 Isaac for Healthcare 内的 GPU 加速能力,用于建模解剖结构与器械交互、生成难以采集的场景并训练或评估机器人策略。
推荐理由:原文给出框架的仿真能力、开源入口与并行训练数据,读者可据此判断医疗机器人仿真工作流的复用方式。
量子位在 WAIC 2026 现场总结出十大趋势:Agent 成为约 70% 展商的默认话题,能否完成有效交付取代参数规模成为衡量大模型能力的标准。具身智能从动作演示转向真干活,灵初智能联合长飞切入光模块生产,方案搭载自研大模型 Psi-R2,初步测算可降低生产损耗率约 10%。未来不远机器人以 3000 元/月租赁价落地 500 多个家庭,开展首日 8 台被抢空。
日冕开物与广东远图未来科技启动超级工站战略合作,计划2027年完成百台级部署,未来实现万台级具身智能产品部署。WAIC 2026现场,其超级工站基于自研LaMPA世界模型,在通电后仅训练半小时即完成服务器制造场景的新环境适配。该方案由LaMPA物理世界模型、模块化机器人硬件和Workflow Agent组成,目标形成规划、测试、执行、反馈、进化的闭环。
ROBOTIS 人形机器人部门发布开源 Physical AI 平台 Cyclo Intelligence,面向 AI Worker 的模仿学习工作流,把遥操作数据采集、数据集转换、模型训练(支持 GR00T、PI、ACT 等)和真机实时推理整合为端到端流程。