跳到正文

#Hugging Face

今日 7 条
8月5日周三
  1. HF blog62

    GROVE:从流式视频经验中构建并推理时间分层记忆

    GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。

    推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。

8月4日周二
8月3日周一
7月29日周三
  1. HF blog74

    PruhaNLP 发布 TurboVLA-base:面向 SO-100 机械臂的可微调 VLA 检查点

    PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。

    推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。

7月28日周二
7月27日周一
7月26日周日
7月21日周二
  1. HF blog78

    Pollen Robotics 开源 Grabette:用手持夹爪录制机器人操作数据

    Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。

    推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。

7月20日周一
7月18日周六
  1. ROS Discourse latest22

    ROS 周报:Autoware 发布开源 L2 自动驾驶栈 Vision Pilot,ROS 核心团队一周收到近 50 个未标注的 AI 生成 PR

    Autoware 发布免费开源的 L2 自动驾驶栈 Vision Pilot,AMD 同期启动 Physical AI 黑客松,提供 3 万美元奖金和免费 GPU 算力,8 月 6 日截止提交。ROS 核心贡献者一周内收到近 50 个未标注为 AI 生成的 PR,团队为此新建 triage 看板并呼吁提交者参与评审。

7月16日周四
  1. qbitai78

    原力灵机发布具身世界模型 DW0.5,接入 DFOL2.0 后训练框架

    原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。

    推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。

7月10日周五
  1. HF blog60

    AlayaWorld:长时程可交互视频世界生成框架开源

    AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。

    推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。

7月8日周三
  1. qbitai78

    蚂蚁灵波开源LingBot-VLA 2.0,支持17家厂商20种机器人构型

    蚂蚁灵波科技7月8日宣布升级并开源具身基座模型LingBot-VLA 2.0,预训练融入6万小时真实物理数据,覆盖17个机器人品牌的20种构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。

    推荐理由:原文给出预训练数据规模、支持构型与双臂及移动操作评测对比,可据此判断跨构型VLA基座的落地进展。

  2. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

7月7日周二
  1. NVIDIA blog robotics80

    NVIDIA 与 Hugging Face 将 Isaac GR00T 1.7 和 Isaac Teleop 引入 LeRobot

    NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。

    推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。

  2. HF blog88

    LeRobot v0.6.0 发布:世界模型策略、新 VLA 与奖励模型 API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。

    推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。

4月7日周二
3月10日周二
2月28日周六
1月22日周四
11月28日周五
  1. lerobot releases22

    LeRobot v0.4.2 发布

    Hugging Face 的 LeRobot 发布 v0.4.2,为 Pi0、Pi0.5 和 SmolVLA 加入实时分块(RTC)支持,并新增环境前后处理器。该版本修复了数据集子集请求时的回合过滤 bug 和 delta_timestamp 问题,数据集编码默认改为并行并支持按视频或图像类型动态调整压缩级别。

11月10日周一
  1. lerobot releases20

    LeRobot 发布 v0.4.1

    Hugging Face 的 LeRobot 发布 v0.4.1,新增 EnvHub 支持从 Hub 加载仿真环境,并将 LIBERO 改为 PyPI 包安装、移除原有安装补丁。该版本还修复了数据集特征修改的关键 bug 和数据访问瓶颈以加快训练,并修正 video_key 拼写及训练中的映射边界情况。

10月29日周三
  1. lerobot releases62

    Hugging Face LeRobot 发布 v0.4.0

    Hugging Face 的 LeRobot 发布 v0.4.0,引入 Dataset v3 与流式数据集,并新增 OpenPi、Pi0、Pi0.5 和 NVIDIA GR00T N1.5 策略支持。该版本还加入 Libero、MetaWorld 仿真环境,支持多 GPU 训练,并新增 Intel XPU 后端。完整变更见 v0.3.3...v0.4.0 变更日志。

    推荐理由:LeRobot v0.4.0 的变更清单显示数据集格式与策略支持同步扩展,可据此判断现有训练流程的迁移成本。

8月11日周一
8月7日周四