跳到正文

#模型发布

今日 3 条
7月28日周二
7月27日周一
  1. HF blog74

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。

    推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。

7月24日周五
7月23日周四
7月22日周三
  1. qbitai42

    酷哇科技 WAIC 2026 发布行业首个双层智能体世界模型 COOWAM

    酷哇科技在 WAIC 2026 披露行业首个双层智能体世界模型 COOWAM,由负责物理规律的 CooWAIM 与理解社会规则的 Urban VLM 组成,现场驱动机械臂自主完成切西瓜、拧瓶盖、制作“夏日特调”等长程操作。同期首款重载型四足机器狗 X0 线下首秀,具备 68kg 重载能力,已完成多场景验证并步入真机部署阶段。

7月21日周二
  1. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。

7月20日周一
  1. qbitai42

    国家具身智能应用中试基地发布魔芯科技MoWorld 3D世界模型

    国家具身智能应用中试基地联合华为云、魔芯科技在杭州发布MoWorld 3D世界模型,称其为全球首个全栈基于国产NPU构建的三维世界模型,并同步上线华为云向全行业开放能力。该模型依托基地算力调度与场景验证,将进入智慧交通、应急仿真、城市治理等真实城市场景。

7月19日周日
7月17日周五
7月16日周四
  1. qbitai78

    原力灵机发布具身世界模型 DW0.5,接入 DFOL2.0 后训练框架

    原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。

    推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。

7月14日周二
  1. qbitai76

    高德发布通用世界模型工坊ABot-World Studio,5090单卡可生成小时级交互视频与3D场景

    阿里巴巴旗下高德发布通用世界模型工坊ABot-World Studio并开放测试,可将文字或图片生成可实时交互的AI世界,输出为视频与3DGS文件。该工坊可在单张5090上本地部署,官方实测单次连续推理稳定运行超1小时且无质量衰减,并内置“时空任意门”实现3D世界间跃迁。底层ABot-World0与ABot-3DWorld0模型已全面开源,官网、GitHub及Hugging Face同步上线。

    推荐理由:高德把交互式视频与3DGS场景生成统一进一个工坊,并开源模型,读者可据此了解世界模型的一条新路径。

7月13日周一
  1. qbitai38

    清华现场演示一念Unisonmind:机器狗无脚本走迷宫、指挥人称重

    搭载一念Unisonmind端侧大脑的机器狗“哮天”在清华大学现场演示中,无预设脚本完成看图走三维迷宫、指挥人类用天平称重、估算观众矿泉水瓶剩余水量等随机任务。该大脑以“统一世界Token空间”架构实现全模态输入输出、理解与生成统一,18毫秒对齐一次状态,并已跨本体运行于另一只机器狗、人形机器人和电动轮椅。

7月12日周日
7月10日周五
  1. qbitai78

    蚂蚁灵波发布 LingBot-VA 2.0 具身原生预训练 VA 基座模型

    蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。

    推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。

7月9日周四
  1. qbitai74

    蚂蚁灵波开源 LingBot-Video 具身视频模型

    蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。

7月8日周三
  1. qbitai80

    蚂蚁灵波开源 LingBot-VLA 2.0,6 万小时数据支持 20 多种机器人

    蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。

    推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。

  2. qbitai78

    蚂蚁灵波开源LingBot-VLA 2.0,支持17家厂商20种机器人构型

    蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。

    推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。

7月7日周二
  1. NVIDIA blog robotics80

    NVIDIA 与 Hugging Face 将 Isaac GR00T 1.7 和 Isaac Teleop 引入 LeRobot

    NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。

    推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。

  2. HF blog88

    LeRobot v0.6.0 发布:世界模型策略、新 VLA 与奖励模型 API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。

7月6日周一
  1. qbitai38

    智平方在联合国开源类脑大模型 NeuroVLA 与 AlphaBrain Platform

    智平方科技在联合国开源周展示全球首个原创类脑大模型 NeuroVLA 及一站式开源平台 AlphaBrain Platform,其海外与生态副总裁 Kristine Mo 与图灵奖得主杨立昆同台交流。NeuroVLA 借鉴人脑“皮层—小脑—脊髓”三层协同机制,以更少数据完成学习与决策,使机器人运动抖动降低 75% 以上,脊髓层平均功耗低至 0.4 瓦。

7月3日周五
  1. qbitai71

    地瓜机器人发布 Uranus 世界模型,做具身评测基准与仿真器

    地瓜机器人发布世界模型 Uranus,定位为机器人开发基础设施,用于评测 VLA 与世界模型并支持操作训练仿真。它采用帧级闭环逐帧生成,训练时只见过 2 秒短片段,推理时可稳定运行 60 秒,支持 G1 人形机器人和 Franka 协作臂,目前仅支持 manipulation 训练,尚不支持 locomotion。

7月2日周四
7月1日周三
  1. qbitai78

    英伟达开源机器人技能库 ASPIRE,Jim Fan 称代表全新持续学习范式

    英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。

    推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。

  2. qbitai60

    Om AI联汇发布VLX端侧流式多模态模型系列

    Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。

6月15日周一
6月1日周一
  1. NVIDIA dev blog robotics62

    NVIDIA 发布物理 AI 基础模型 Cosmos 3

    NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。

    推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。

5月18日周一
4月13日周一
  1. DeepMind blog78

    DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理与仪表读数能力

    DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。

    推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。

3月14日周六
  1. NVIDIA dev blog robotics52

    NVIDIA 用 Cosmos 世界基础模型扩展合成数据与物理 AI 推理

    NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。