跳到正文

数据与遥操作

追踪数据与遥操作的研究、可复用工程方法与真实部署证据。

106条精选

最新精选

第 61–80 条 · 共 106 条
8月19日周三
  1. HF blog78

    NeDM Study 4 数据集发布:宇树 Go2 在 CRM 颗粒地形上的神经降维动力学复现材料

    Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。

    推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。

8月14日周五
  1. HF blog70

    用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 打通录制、训练与部署闭环

    AWS 开源 SDK Strands Robots 发布教程,演示如何用同一个 Robot() 对象完成录制 LeRobotDataset、同步到 Hugging Face Storage Buckets、从 Hub 流式读取训练、再以 mode="real" 部署回 SO-101 硬件,全程保持 LeRobot 磁盘格式不变。

    推荐理由:以 Strands Robots 为例拆解录制、去重同步、流式训练到真机部署的完整数据闭环,含可运行 notebook 与实测数字。

8月6日周四
  1. HF blog71

    Ego2Robot:从第一视角人类视频合成可扩展机器人训练数据

    Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。

    推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。

  2. HF blog62

    BridgeVLA++:面向 3D 操作的数据高效、可泛化、记忆增强 VLA 框架

    BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。

    推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。

  3. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
  1. HF blog71

    MiniWorld:从零训练视频世界模型的可复现框架

    MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。

    推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。

  2. HF blog62

    GROVE:从流式视频经验中构建并推理时间分层记忆

    GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。

    推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。

8月4日周二
  1. HF blog62

    SG-WAM:在几何感知策略空间中自引导世界建模

    SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。

    推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。

7月30日周四
  1. qbitai78

    World Labs 发布 R2S2R 机器人策略训练与评估引擎

    World Labs 发布机器人策略训练与评估引擎 Real-to-sim-to-real(R2S2R),由 Real-to-Sim 与 Sim-to-Real 两部分组成,把现实任务重建为可交互虚拟世界并完成策略训练、评估与部署。

    推荐理由:World Labs 把世界模型从生成虚拟世界延伸到机器人策略训练与评估,读者可了解 R2S2R 的闭环构成与仿真到真机的对齐方式。

7月29日周三
  1. BAIR62

    从 CUDA 到 MLX:K-Search 如何把内核优化经验迁移到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。

    推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。

  2. HF blog74

    PruhaNLP 发布 TurboVLA-base:面向 SO-100 机械臂的可微调 VLA 检查点

    PruhaNLP 在 Hugging Face 发布 TurboVLA-base,一个面向 SO-100 / SO-101 机械臂的可直接微调 VLA 检查点,单个文件夹内含 config、完整权重(DINOv3 ViT-B + BERT + 交互层 + 动作解码器)与 tokenizer。

    推荐理由:读者可据此了解一个去掉 LLM 的 VLA 检查点如何组装、微调与在 SO-100 上部署。

7月28日周二
  1. HF blog62

    论文提出具身操作数据金字塔,梳理五类数据来源与数据配方

    论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。

    推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。

7月27日周一
  1. HF blog74

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人仿真器

    NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的实时生成式手术机器人仿真器,由 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 上运行。

    推荐理由:原文给出从离线世界模型到实时交互仿真的蒸馏与推理链路,可了解手术机器人策略评估环境的构建方式。

7月26日周日
7月22日周三
  1. NVIDIA blog robotics71

    NVIDIA 开源首个 GPU 加速医疗物理仿真框架

    NVIDIA 开源 Medical Physics Simulation 框架,作为 Isaac for Healthcare 内的 GPU 加速能力,用于建模解剖结构与器械交互、生成难以采集的场景并训练或评估机器人策略。

    推荐理由:原文给出框架的仿真能力、开源入口与并行训练数据,读者可据此判断医疗机器人仿真工作流的复用方式。

7月21日周二
  1. HF blog78

    Pollen Robotics 开源 Grabette:用手持夹爪录制机器人操作数据

    Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪加双摄像头录制操作示范,自动转成 LeRobot 格式数据集。Grabette 硬件物料成本约 490€,配套机械臂末端夹爪 Gripette 约 120€,采集数据经 RTAB-MAP SLAM 处理后在浏览器中完成转换。

    推荐理由:开源手持夹爪加浏览器处理流程,把真机操作数据采集从遥操作里解放出来,可据此判断数据采集门槛的变化。

  2. HF blog62

    ReflectWorld-MM:面向开放视频流的实体导向多模态记忆系统

    ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。

    推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。

  3. HF blog78

    RynnBrain 1.1 发布:具身基础模型新增接触点预测与 3D 定位

    RynnBrain 1.1 发布,是覆盖 2B、9B 和 122B-A10B 三个规模的具身基础模型家族,在 1.0 基础上为全系列引入接触点预测,并为 2B 和 9B 模型加入原生 3D 定位。

    推荐理由:RynnBrain 1.1 在 1.0 基础上加入接触点预测与原生 3D 定位,并给出多本体真机部署结果,可据此了解具身基础模型的能力边界。