跳到正文

全部动态

今日 3 条
7月12日周日
7月10日周五
  1. qbitai78

    蚂蚁灵波发布 LingBot-VA 2.0 具身原生预训练 VA 基座模型

    蚂蚁灵波发布 LingBot-VA 2.0,称其为全球首个具身原生预训练 VA 基座模型,从架构、数据到训练目标均为机器人定制。模型采用因果 DiT 加稀疏 MoE 主干,视频主干总参数约 13B、推理激活约 1.9B,训练参数量约 15.3B、每 token 推理激活约 2.5B。

    推荐理由:蚂蚁灵波 LingBot-VA 2.0 从架构到训练目标均为机器人定制,读者可了解具身原生 VA 基座的设计取舍与实测数据。

7月9日周四
  1. qbitai74

    蚂蚁灵波开源 LingBot-Video 具身视频模型

    蚂蚁灵波开源 LingBot-Video,称其为面向具身智能的大规模 MoE 视频基础模型,采用 30B 参数、推理时激活约 3B。模型引入超 70000 小时具身相关视频,覆盖机器人操作、导航与第一视角等场景,并加入物理合理性、任务完成度等多维奖励。团队称其在 RBench 上超过通用视频生成标杆模型,并已在 TI2V 任务的开源竞品中达到 SOTA。

7月8日周三
  1. qbitai80

    蚂蚁灵波开源 LingBot-VLA 2.0,6 万小时数据支持 20 多种机器人

    蚂蚁灵波发布并开源通用 VLA 模型 LingBot-VLA 2.0,预训练数据达 6 万小时,其中 5 万小时来自覆盖 20 种机器人构型的真机轨迹数据,1 万小时来自第一视角人类操作视频。

    推荐理由:蚂蚁灵波开源 LingBot-VLA 2.0,读者可了解其 6 万小时数据规模、20 种本体覆盖及 GM-100 对比结果。

  2. qbitai78

    蚂蚁灵波开源LingBot-VLA 2.0,支持17家厂商20种机器人构型

    蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。

    推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。

7月7日周二
  1. NVIDIA blog robotics80

    NVIDIA 与 Hugging Face 将 Isaac GR00T 1.7 和 Isaac Teleop 引入 LeRobot

    NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。

    推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。

7月6日周一
  1. qbitai38

    智平方在联合国开源类脑大模型 NeuroVLA 与 AlphaBrain Platform

    智平方科技在联合国开源周展示全球首个原创类脑大模型 NeuroVLA 及一站式开源平台 AlphaBrain Platform,其海外与生态副总裁 Kristine Mo 与图灵奖得主杨立昆同台交流。NeuroVLA 借鉴人脑“皮层—小脑—脊髓”三层协同机制,以更少数据完成学习与决策,使机器人运动抖动降低 75% 以上,脊髓层平均功耗低至 0.4 瓦。

7月2日周四
7月1日周三
  1. qbitai78

    英伟达开源机器人技能库 ASPIRE,Jim Fan 称代表全新持续学习范式

    英伟达开源机器人技能库 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),让机器人用代码执行任务、失败后看多模态执行轨迹再修程序,把验证过的修复经验沉淀进不断扩展的 skills library。

    推荐理由:英伟达开源机器人技能库 ASPIRE,把失败修复经验沉淀为可复用 Skill,读者可了解 Code as Policy 的持续学习思路。

  2. qbitai60

    Om AI联汇发布VLX端侧流式多模态模型系列

    Om AI联汇发布面向物理世界的端侧流式多模态模型系列VLX,提出流式多模态架构,以流式编码与缓存增量推理实现毫秒级实时感知。VLX由三款模型构成,VLX-Flow负责持续感知,VLX-Seek将坐标生成转化为区域检索实现定位,VLX-Go将视觉理解转化为机器人可执行的短时航点与运动轨迹。该系列覆盖0.6B至10B规格,单路延迟最低0.06秒,在端侧打通持续感知、精准定位到行动决策的闭环。

6月15日周一
6月1日周一
  1. NVIDIA dev blog robotics62

    NVIDIA 发布物理 AI 基础模型 Cosmos 3

    NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,结合物理推理能力。该模型面向机器人、自动驾驶和智能空间,用于理解现实世界、预测后续变化并生成针对特定环境、本体和任务的动作。

    推荐理由:NVIDIA 发布面向物理 AI 的前沿基础模型 Cosmos 3,读者可了解其推理、世界与动作模型的定位。

5月18日周一
4月13日周一
  1. DeepMind blog78

    DeepMind 发布 Gemini Robotics-ER 1.6,增强空间推理与仪表读数能力

    DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理、多视角理解和成功检测能力,并新增仪表读数功能,可读取压力表、液位计等工业仪表。

    推荐理由:Gemini Robotics-ER 1.6 在指向、计数、成功检测和仪表读数上的能力变化,以及通过 API 和 AI Studio 开放使用,可供开发者评估其作为机器人高层推理模型的适用性。

3月14日周六
  1. NVIDIA dev blog robotics52

    NVIDIA 用 Cosmos 世界基础模型扩展合成数据与物理 AI 推理

    NVIDIA 发布博文介绍 Cosmos 世界基础模型,用于扩展合成数据与物理 AI 推理。文章指出人形机器人和自动驾驶等 AI 驱动机器人依赖高保真、物理感知的训练数据,缺乏多样且具代表性的数据集会导致泛化能力差、对真实世界变化接触有限以及边缘情况行为不可预测,而收集大规模真实世界数据集存在困难。

2月11日周三
  1. NVIDIA dev blog robotics62

    R²D²:用 NVIDIA Isaac Lab 扩展多模态机器人学习

    NVIDIA 开发者博客介绍 R²D²,一种借助 NVIDIA Isaac Lab 扩展多模态机器人学习的方法。文章指出真实世界采集数据昂贵、缓慢且危险,难以安全训练高速碰撞或硬件故障等风险场景,且真实数据通常偏向正常条件。原文正文在此处截断,未给出 R²D² 的具体方法、数据规模或实验结果。

    推荐理由:介绍 R²D² 如何借助 Isaac Lab 在仿真中扩展多模态机器人学习,可了解其应对真实数据采集难题的思路。

1月9日周五
  1. NVIDIA dev blog robotics62

    NVIDIA 用仿真到真实工作流构建 Isaac GR00T N1.6 通用人形能力

    NVIDIA 发布 Isaac GR00T N1.6,用于构建人形机器人的通用能力,覆盖感知、规划与全身控制。该工作流将仿真、控制与学习统一起来,让机器人在进入真实世界前先习得复杂技能。

    推荐理由:NVIDIA 官方给出 GR00T N1.6 的仿真到真实工作流,读者可了解人形机器人通用能力训练如何统一仿真、控制与学习。

1月6日周二
11月28日周五
  1. lerobot releases22

    LeRobot v0.4.2 发布

    Hugging Face 的 LeRobot 发布 v0.4.2,为 Pi0、Pi0.5 和 SmolVLA 加入实时分块(RTC)支持,并新增环境前后处理器。该版本修复了数据集子集请求时的回合过滤 bug 和 delta_timestamp 问题,数据集编码默认改为并行并支持按视频或图像类型动态调整压缩级别。

8月11日周一
8月9日周六
  1. NVIDIA dev blog robotics58

    NVIDIA Research 发布 R²D²:用世界基础模型与工作流提升机器人训练

    NVIDIA Research 发布 R²D²,提出用世界基础模型(WFM)与配套工作流提升机器人训练。WFM 是经过训练、可基于真实环境动态模拟、预测并推理未来世界状态的生成式 AI 模型,用于应对物理 AI 系统对丰富标注数据日益增长的需求。文中提到 NVIDIA Cosmos 是相关平台。