跳到正文

#论文/研究

今日 0 条
7月28日周二
  1. HF blog62

    论文提出具身操作数据金字塔,梳理五类数据来源与数据配方

    论文《Data Pyramid for Embodied Manipulation》将具身机器人学习数据组织为五类互补来源的金字塔,包括真实机器人数据、UMI 风格数据、第一人称与第三人称视角数据、仿真数据和通用视觉语言数据。

    推荐理由:论文把具身数据来源整理成五层金字塔,并梳理各类数据配方与基础模型能力之间的对应关系。

  2. HF blog43

    机器人学习中的进度奖励建模:一篇综合性综述

    一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。

7月27日周一
7月26日周日
7月21日周二
  1. HF blog54

    Apple-π 发布以物理定律为锚的视频模型基准

    Apple-PI 提出一个以物理定律为锚的基准,用分阶段推理评测诊断视频生成模型在模拟经典力学时的失效位置。该基准包含 Orchard 数据集,覆盖经典力学十类典型任务的 400 段视频,区分单定律与多定律任务;评测协议分感知、公式化、演绎三阶段,采用链式帧提示,并将生成视频视为模型的可见推理轨迹。

  2. HF blog62

    ReflectWorld-MM:面向开放视频流的实体导向多模态记忆系统

    ReflectWorld-MM 是一个面向开放视频流的实体导向多模态记忆系统,用分层长期记忆围绕持续存在的实体组织观察,以改进跨时间的跟踪与推理。系统包含三部分:在有限短期记忆下把音视频流转化为实体解析观察的感知前端、基于人类记忆理论的分层长期记忆(耦合多尺度情景记忆、演进的实体中心语义记忆与程序性记忆),以及可接入现成助手的完整实现。

    推荐理由:论文提出面向开放视频流的实体导向多模态记忆系统,读者可了解其分层记忆结构与六项基准表现。

  3. HF blog44

    JoyNexus:面向 VLA 模型的多租户后训练服务

    JoyNexus 是面向视觉语言动作(VLA)模型的多租户服务,通过解耦 API、隔离租户槽位和分组批处理,支持共享资源上的训练、推理与评估。它解耦训练模型服务、推理模型服务和环境服务,各租户的动作模块、优化器、rollout 记录与策略版本相互隔离,由全局训练队列和推理队列调度。仿真与真实具身场景评估显示,相比单租户独立执行,JoyNexus 降低了总 GPU 时间并提升了服务利用率。

7月20日周一
  1. HF blog60

    See like a Robot:面向 VLA 的机器人中心点图

    论文提出机器人中心点图(robot-centric pointmaps),像素存储场景点在机器人坐标系下的三维坐标,从而对齐视觉观测与机器人坐标系动作,缓解 VLA 中相机视角与动作定义之间的坐标系错配。

    推荐理由:论文提出以机器人坐标系点图替代相机视角输入,读者可了解跨视角泛化在仿真与真机上的验证方式。

7月10日周五
  1. HF blog60

    AlayaWorld:长时程可交互视频世界生成框架开源

    AlayaWorld 是一个开源全栈框架,用于构建可实时交互的生成式世界,支持自由导航及战斗、施法、召唤怪物等多样动作。该框架统一了数据准备、模型架构、训练、推理加速与部署,并开源可复现管线、参考实现、评测工具与文档。论文称其基于游戏录像和真实视频训练,可捕捉多样视觉外观与物理动态,为游戏之外的具身智能等交互应用提供机会。

    推荐理由:论文给出可复现的视频世界模型全栈框架,读者可了解其模块化架构与开源管线如何支撑实时交互生成。

  2. HF blog71

    RynnWorld-Teleop:面向数字遥操作的动作条件世界模型

    论文提出 RynnWorld-Teleop,一种动作条件世界模型,用生成式世界模型替代实体机器人实现数字遥操作,将操作者手部姿态流转化为机器人视角的高保真视频,并作为与本体无关的动作标签经重定向迁移到任意目标机器人。

    推荐理由:论文提出用生成式世界模型替代实体机器人采集数据,读者可了解数字遥操作如何解耦硬件约束并生成可迁移轨迹。

  3. HF blog71

    RynnWorld-4D:面向机器人操作的 4D 具身世界模型

    RynnWorld-4D 是一个多模态 4D 世界模型,可从单张 RGB-D 图像和语言指令出发,在统一扩散过程中同步生成未来的 RGB 帧、深度图和光流。其三分支架构结合跨模态注意力与逐帧 3D RoPE,并配套超过 2.544 亿帧的 Rynn4DDataset 1.0 数据集。

    推荐理由:论文提出用同步 RGB、深度与光流构建 4D 世界模型,并给出策略头与大规模数据集,可供世界模型与操作研究者参考。

7月8日周三
  1. HF blog69

    论文:LingBot-VLA 2.0 从基础模型走向实际应用

    LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。

    推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。

  2. HF blog67

    Image2Sim:用生成式神经模拟器扩展具身导航

    Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。

    推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。

  3. HF blog39

    PointDiT:面向单目几何估计的像素空间扩散模型

    PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。

  4. HF blog53

    SIEVE:面向 VLA 模仿学习的结构感知数据选择方法

    SIEVE 是一种面向 VLA 模仿学习的结构感知数据选择方法,将示范轨迹视为可复用视觉运动基元与转换接口的组合。它从机器人轨迹中发现可复用基元,按结构信息量分配数据预算,并挑选更易被行为克隆学习的中心稳定示范。作者称该方法在多个数据集、基准和 VLA 模型上稳定优于数据选择基线,仅用 50% 数据加 50% 训练步数即超过全量数据训练。

7月7日周二
  1. HF blog62

    GaP:面向变异性自动化任务的图即策略多智能体自学习框架

    GaP 是一种图即策略(Graph-as-Policy)多智能体编码框架,从模块化开放机器人技能库(MORSL)生成含感知、规划和控制节点的有向计算图,并构建内部仿真环境并行演练不同图以迭代优化结构与参数,提升成功率和吞吐量。

    推荐理由:论文提出用多智能体编码生成计算图并并行仿真迭代,为变异性自动化任务提供可复用的可靠性思路。

  2. HF blog62

    SVA:将树搜索蒸馏为动作评估以增强冻结 VLA 模型

    论文提出 SVA(Search, Value, and Act)框架,将动作生成与后果评估解耦,为冻结的 VLA 策略引入长期后果感知。SVA 先用蒙特卡洛树搜索在仿真中探索 VLA 输出分布并收集带经验回报的轨迹,再蒸馏为轻量 Q 值模型,部署时由冻结 VLA 提出多个候选、评估器选出不确定性正则化后 Q 值最高的动作,无需仿真器。

    推荐理由:论文提出冻结 VLA 的动作评估框架,用树搜索蒸馏 Q 值模型,读者可了解测试时扩展的替代思路。

6月3日周三
  1. NVIDIA blog robotics74

    NVIDIA Research 在 CVPR 发布 GraspGen-X、LCDrive 与 NitroGen 三项研究

    NVIDIA Research 在 CVPR 展示三篇论文:首个零样本抓取基础模型 GraspGen-X 基于 20 亿次仿真抓取训练,可为未见过的夹爪和物体生成抓取位姿。

    推荐理由:三篇论文分别覆盖零样本抓取、自动驾驶推理加速与虚拟环境智能体训练,可了解规模化训练如何提升跨场景泛化。

4月20日周一
  1. BAIR62

    GRASP:面向世界模型长时程规划的梯度规划器

    BAIR 提出 GRASP,一种面向学习动力学世界模型的梯度规划器,通过把轨迹提升到虚拟状态实现跨时间并行优化、对状态迭代加噪探索,并重塑梯度只依赖动作雅可比。

    推荐理由:GRASP 把长时程规划拆成可并行的时间步并绕开脆弱的状态梯度,Push-T 上成功率与耗时对比给出了可参考的量化差异。

2月11日周三
  1. NVIDIA dev blog robotics62

    R²D²:用 NVIDIA Isaac Lab 扩展多模态机器人学习

    NVIDIA 开发者博客介绍 R²D²,一种借助 NVIDIA Isaac Lab 扩展多模态机器人学习的方法。文章指出真实世界采集数据昂贵、缓慢且危险,难以安全训练高速碰撞或硬件故障等风险场景,且真实数据通常偏向正常条件。原文正文在此处截断,未给出 R²D² 的具体方法、数据规模或实验结果。

    推荐理由:介绍 R²D² 如何借助 Isaac Lab 在仿真中扩展多模态机器人学习,可了解其应对真实数据采集难题的思路。

12月13日周六
11月5日周三
11月1日周六
9月29日周一
9月26日周五
8月9日周六
  1. NVIDIA dev blog robotics58

    NVIDIA Research 发布 R²D²:用世界基础模型与工作流提升机器人训练

    NVIDIA Research 发布 R²D²,提出用世界基础模型(WFM)与配套工作流提升机器人训练。WFM 是经过训练、可基于真实环境动态模拟、预测并推理未来世界状态的生成式 AI 模型,用于应对物理 AI 系统对丰富标注数据日益增长的需求。文中提到 NVIDIA Cosmos 是相关平台。