Zero-Mem:面向 LLM Agent 的零 Token 记忆操作
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
Hugging Face 的 LeRobot 发布 v0.6.1,将 lerobot.types 模块更名为 lerobot.lerobot_types,属破坏性变更。
Hugging Face 上出现模型 imjustheretotest/MasonAI,其基座模型为 crosbylegal/gpt-5.6-luna,训练数据集为 Crownelius/GPT-5.6-Sol-Luna-Terra-Traces。该模型 README 内容为空,上月下载量未被追踪,且暂无 Inference Provider 部署。
PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。
推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
Hugging Face 论文页发布 IDEAgent,用智能体质量-多样性搜索生成研究想法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或样本规模等具体结果。
VisCo 提出用大语言模型作为内在编码器来压缩视觉 token。该论文页面已在 Hugging Face 上线,具体方法与实验结果尚未在页面内容中给出。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。
推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。
DiffGI 用连续 2D TSDF 和可微 Marching Squares 模块替换几何图像中的二值占用图,使整条流水线端到端可微,可在消费级 GPU 上约一秒完成高保真薄壳 3D 生成,甚至能在笔记本 CPU 上运行,无需服务器。项目主页已上线,交互式 demo 即将推出。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。
推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。
Hugging Face 的 LeRobot 发布 v0.6.0,带来多项破坏性变更:pip install lerobot 不再包含数据集与训练依赖,需按需安装如 lerobot[training]。
推荐理由:LeRobot v0.6.0 的破坏性变更清单和新增基准、策略,能帮现有用户判断升级成本与可迁移能力。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。
NVIDIA 与 Hugging Face 合作,将 NVIDIA Isaac GR00T 1.7 开放推理视觉语言动作模型和 NVIDIA Isaac Teleop 框架引入 Hugging Face 的开源机器人库 LeRobot,NVIDIA Cosmos 3 计划随后加入。
推荐理由:NVIDIA 与 Hugging Face 把 GR00T 1.7 和 Isaac Teleop 接入 LeRobot,读者可了解开放机器人开发流程的整合方式。
LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,以及 GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT 等新 VLA 和 Robometer、TOPReward 奖励模型 API。
推荐理由:LeRobot v0.6.0 一次放出世界模型策略、多个 VLA 与奖励模型 API,读者可据此判断开源机器人学习栈的能力边界。
Hugging Face 的 LeRobot 发布 v0.5.1,为 pi0、pi0.5 和 pi0_fast 策略新增相对动作支持,并加入 HIL/Dagger/HG-Dagger/RaC 风格数据采集功能。
Hugging Face 的 LeRobot 发布 v0.5.0,新增宇树 G1 全身控制(WBC)实现,并将最低 Python 版本要求提升至 3.12。该版本还升级 transformers v5、加入可复现训练的 cudnn_deterministic 选项,并修复数据集转换与异步推理中的多处问题。
Hugging Face 的 LeRobot 发布 v0.4.4,新增 OpenArm 机器人及遥操作器、OpenArm Mini 遥操作器、达妙电机与 CAN 总线、RobStride CAN 实现,并加入 G1 遥操作支持。
Hugging Face 的 LeRobot 发布 v0.4.3,新增 X-VLA 策略和基于 tokenization 的自回归 VLA PiFast,并加入 Unitree G1、OMX、Earth Rover Mini Plus 等机器人支持。
Hugging Face 的 LeRobot 发布 v0.4.2,为 Pi0、Pi0.5 和 SmolVLA 加入实时分块(RTC)支持,并新增环境前后处理器。该版本修复了数据集子集请求时的回合过滤 bug 和 delta_timestamp 问题,数据集编码默认改为并行并支持按视频或图像类型动态调整压缩级别。
Hugging Face 的 LeRobot 发布 v0.4.1,新增 EnvHub 支持从 Hub 加载仿真环境,并将 LIBERO 改为 PyPI 包安装、移除原有安装补丁。该版本还修复了数据集特征修改的关键 bug 和数据访问瓶颈以加快训练,并修正 video_key 拼写及训练中的映射边界情况。
Hugging Face 的 LeRobot 发布 v0.4.0,引入 Dataset v3 与流式数据集,并新增 OpenPi、Pi0、Pi0.5 和 NVIDIA GR00T N1.5 策略支持。该版本还加入 Libero、MetaWorld 仿真环境,支持多 GPU 训练,并新增 Intel XPU 后端。完整变更见 v0.3.3...v0.4.0 变更日志。
推荐理由:LeRobot v0.4.0 的变更清单显示数据集格式与策略支持同步扩展,可据此判断现有训练流程的迁移成本。
NVIDIA 在 GTC 2025 首次发布的 Cosmos Reason 是一个开放且可完全定制的推理视觉语言模型(VLM),面向物理 AI 与机器人,让机器人和视觉 AI 智能体借助先验知识、物理理解和常识进行推理,从而在真实世界中理解并行动。该模型已在 Hugging Face 的 Physical Reasoning 排行榜上登顶。
Hugging Face 的 LeRobot 发布 v0.3.3,修复了策略构建问题,并引入面向 LeRobot 的通用处理器 pipeline。该版本还更新了安装说明与文档链接、修正作者姓名拼写,并将 torch 包版本改为向上取整约束。