Hugging Face 上的 tavishh/robotarm:ACT(CVAE)SO-101 方块与圆柱抓放
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。
NVIDIA 发布 Cosmos 3 开放物理 AI 世界基础模型家族,基于 mixture-of-transformers 架构,同时支持视觉推理、世界生成与动作预测。
推荐理由:Cosmos 3 以开放权重和三种规模覆盖世界生成与动作预测,读者可据此判断物理 AI 团队如何做后训练与部署。
NVIDIA 提出世界动作模型(World Action Models),用于解决机器人策略泛化难题:仅在训练场景成功的策略,在物体形状、位置或光照变化时往往失效。该模型让策略理解任务背后的物理规律,而非单纯模仿示范,这一能力来自其骨干网络。
NVIDIA 发布 Alpamayo 2 Super,这是一个 340 亿参数的开源推理视觉模型,用于自动驾驶开发。原文指出,以往轨迹生成、高层意图预测、场景理解和数据标注往往依赖彼此独立的模型,导致相关输出难以比较、模型行为难以排查、表示也难以在开发流程中复用;Alpamayo 2 Super 将这些能力整合到同一模型中。
IEEE Spectrum 的 Video Friday 合集展示了多款机器人视频:Google DeepMind 的 Gemini Robotics 2 作为智能层实现全身控制、灵巧操作与多机器人协作;Hello Robot 推出可在家中安全导航的单臂三轮机器人 Stretch 4.0;南加州大学与 NASA 等合作训练机器狗用于火星、月球等行星探索。
DeepMind 发布 Gemini Robotics ER 2 具身推理模型,作为机器人的高层大脑负责对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型。
推荐理由:官方给出进度分类、时刻定位与多机协作的量化结果,可据此判断高层推理模型与底层 VLA 的分工方式。
World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。
推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。
Hugging Face 上出现模型 imjustheretotest/MasonAI,其基座模型为 crosbylegal/gpt-5.6-luna,训练数据集为 Crownelius/GPT-5.6-Sol-Luna-Terra-Traces。该模型 README 内容为空,上月下载量未被追踪,且暂无 Inference Provider 部署。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧 VLA 模型 Gemini Robotics On-Device 2。
推荐理由:DeepMind 发布三款机器人模型,覆盖全身控制、灵巧操作与端侧部署,可了解 VLA 与具身推理的分工。
智在无界(BeingBeyond)发布 Being-H0.8,称其为首个基于人类视频数据的隐式触觉世界动作模型,在 Being-H0.7 基础上首次把触觉模态纳入隐空间表示。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。
推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队 WorldScore 榜单,模型已适配国产昇腾算力,代码和权重全部开源(https://github.com/PKU-YuanGroup/UniWorld-View)。
科大讯飞新成立的安徽爻方智能联合中国科学技术大学、聆动通用机器人发布技术报告 iFLYTEK-Embodied-Omni,主张 VLA 不是终局,世界模型还需补上本体认知这一环。
优艾智合研发的FabriVLA在Evo-SOTA榜单的Meta-World MT50基准中以90.0%的tier-average成功率登顶第一,超过包括π0在内的国际模型,参数规模为1B级。
它石智航在2026年WAIC首发具身原生基座模型AWE 3.5,并现场演示1:1还原的环形线束流水线,多台机器人集群协作、同一基础模型不切换参数完成装配、插接、收纳等任务。
酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。
RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。
推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。
国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。
面壁智能在WAIC期间发布并开源MiniCPM-Robot系列模型,包含1.5B的通用VLA模型MiniCPM-RobotManip和0.9B的跟踪导航模型MiniCPM-RobotTrack,并同步开源具身智能推理框架PhyAI。
推荐理由:面壁开源1.5B与0.9B两个机器人模型,读者可据此了解小尺寸VLA在记忆与端侧部署上的取舍。
昆仑万维子公司黎曼动力在WAIC 2026发布通用机器人操作世界动作模型Riemann-1.0,在RoboCasa-365家务基准上以62.6%成功率登顶,比此前SOTA高8.4个百分点。
推荐理由:读者可了解黎曼动力如何用20万小时人类第一视角视频预训练世界动作模型,并看到消融实验给出的增益幅度。
魔法原子在 2026 世界人工智能大会(WAIC)期间展示自研通用具身大模型 Magic-VLA K02,现场完成叠盒封胶、柔性衣物整理和行李箱收纳等长程任务,其中叠盒封胶组合式长程任务成功率超过 90%。
文远知行发布物理AI认知基础大模型WITT,提出“最小物理事实单元”概念,将道路视频拆解为可识别、验证的事实单元,形成事实提取、事实推理、事实验证、事实编排四项能力。
银河通用发布面向具身智能大模型的测试时后训练框架 WAM-TTT,将 Test-Time Training 迁移至机器人控制,无需重新预训练或人类动作标注,仅用未标注人类 RGB 视频即可在部署阶段适配新场景。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
阿里巴巴旗下高德发布通用世界模型工坊ABot-World Studio并开放测试,可将文字或图片生成可实时交互的AI世界,输出为视频与3DGS文件。该工坊可在单张5090上本地部署,官方实测单次连续推理稳定运行超1小时且无质量衰减,并内置“时空任意门”实现3D世界间跃迁。底层ABot-World0与ABot-3DWorld0模型已全面开源,官网、GitHub及Hugging Face同步上线。
推荐理由:高德把交互式视频与3DGS场景生成统一进一个工坊,并开源模型,读者可据此了解世界模型的一条新路径。
中国具身智能公司 X Square Robot 公开其具身 AI 全栈方案,主张由数据、世界模型与动作模型三层组成,并逐步开源相关组件。其数据系统 QUANXTA Zero 用穿戴式双夹爪采集示范,通过真机回放校验,报告约 85% 数据有效率,并称用少量真机数据锚定可达到全真机数据集相当性能、采集成本约低 20 倍。
搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。
哈工大(深圳)杨朔团队发布面向灵巧操作的触觉世界模型 TouchWorld,让机器人预测接触状态并利用高频触觉反馈修正动作。团队此前已推出 EgoTouch 和 TouchAnything,分别解决触觉数据采集与从第一人称视频恢复触觉,杨朔同时创办破晓智能(PHANES AI)。
蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。
推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。
7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0,基于自回归架构从头预训练,采用语义视觉-动作分词器、因果预训练、MoE架构和异步推理机制,实现单卡150Hz实时推理效率。
原力灵机在开发者大会上发布新一代具身基础模型DM0.5,参数规模4B较上一代DM0翻倍,数据量增加400%,由5万小时真机操作数据、10万小时第一视角数据和100万平方米场景重建数据构成。
蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。
7月9日,蚂蚁灵波科技开源新一代实时交互世界模型LingBot-World 2.0(又称LingBot-World-Infinity),支持小时级实时生成、720p/60fps高清实时输出,并首次将Agent机制引入世界模型。
7月9日,蚂蚁灵波开源LingBot-Video,称其为全球首个基于MoE架构、面向具身智能的开源视频生成基础模型。该模型采用DiT+MoE设计,30B总参数生成时仅激活约3B参数,相比同等规模Dense架构约有3倍推理效率,并引入VLA、VLN、Ego等共7万小时具身数据。
General Intuition 上月以 23 亿美元估值融资 3.2 亿美元,其 CEO Pim de Witte 认为具身 AI 会像大语言模型一样走向通用基础模型,而非为每个本体和环境单独采集海量真实数据。
魔芯科技联合浙江大学潘云鹤院士、华为等发布实时交互世界模型 MoWorld,全栈基于国产 NPU,14B 参数 MoE 模型实现最高 50FPS 推理,推理成本为同规模 GPU 方案的 30%。
蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。
推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。
蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。
推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。