跳到正文

论文与研究

机器人与具身智能领域的论文与研究,保留来源、阶段和证据边界。

83条精选

最新精选

第 1–20 条 · 共 83 条
今天10月1日周四
  1. arXiv cs.RO62

    SteerQuant:用动作引导缩放控制世界动作模型的量化误差

    SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。

    推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。

  2. arXiv cs.RO62

    TeV:面向生成式机器人策略的时序动作验证框架

    论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。

    推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。

  3. arXiv cs.RO66

    URAI:让前沿智能体编写、调用并演化机器人工具

    论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。

    推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。

  4. arXiv cs.RO62

    OccluDex:面向自遮挡下第一视角灵巧操作的分层三维视触觉表征学习

    OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。

    推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。

  5. arXiv cs.RO62

    FunCo-Grasp:面向跨本体灵巧抓取生成的功能对应方法

    FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。

    推荐理由:论文提出跨本体灵巧抓取的功能对应方法,读者可了解无需目标手抓取数据即可迁移到未见手的思路与仿真真机结果。

  6. arXiv cs.RO62

    NEXUS:面向地形自适应遥操作的感知全身控制框架

    NEXUS 是一个感知全身控制框架,将人类动作指令与机器人本体感知反馈结合,使机器人在与操作者地形不一致时仍能复现行为。作者提出可扩展的地形自适应算法,无需逐动作或逐地形调参即可生成高质量配对动作,并构建近 1000 小时的配对动作语料,通过教师-学生学习训练控制器。实验显示 NEXUS 在评测基准上优于现有全身控制器,并实现零样本真机部署,在多种未见地形上完成实时全身遥操作。

    推荐理由:论文提出跨地形全身遥操作框架,用近1000小时配对动作数据训练感知控制器,并给出零样本真机部署结果。

  7. arXiv cs.RO62

    Cue the Flow:用空间线索引导流匹配策略完成开放世界配送操作

    论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。

    推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。

  8. arXiv cs.RO62

    Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

    Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

    推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。

  9. arXiv cs.RO71

    SimEX:仿真集成的机器人自动研究框架

    SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。

    推荐理由:论文提出仿真与编码智能体结合的自动研究框架,读者可了解无示范条件下获取真机操作技能的两阶段方法。

  10. arXiv cs.RO60

    Video2SwimFish:从真实鱼视频重建可控鱼模型与生物运动

    Video2SwimFish 提出一套自动化流程与基准,从真实鱼的多视角同步视频重建带尺度形变网格,通过 VLM actor-critic 循环生成适配个体形态的内部关节,并从观测到的中线曲率提取 Biological Locomotion Manifold(BLM),作为受真实鱼运动约束的低维动作空间,为每条重建鱼学习个体游动策略。

    推荐理由:论文公开了从真实鱼视频重建可控游动资产的数据集与基准,并指出任务成功率与个体运动保真度并不一致。

  11. arXiv cs.RO66

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉

    研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。

    推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。

  12. arXiv cs.RO60

    LME:面向未知环境导航的局部极小值逃逸子目标生成框架

    作者提出 LME(Local-Minimum Escaper),一个程序化分层框架,通过显式生成并推理子目标,引导移动机器人脱离局部极小值区域。LME 仅依赖局部观测,用可解释的启发式准则结合障碍几何与候选位置安全性来选取子目标,再由局部规划器生成底层运动指令,无需额外训练且不依赖具体局部规划器。

    推荐理由:论文提出用可解释启发式生成子目标来摆脱局部极小值,且不依赖底层规划器、无需额外训练。

  13. arXiv cs.RO71

    EmbodiRSI:面向数据高效机器人适配的递归自改进系统

    EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。

    推荐理由:论文给出真实到仿真再回真实的递归自改进流程,读者可了解用少量真机轨迹完成策略适配的具体做法。

  14. arXiv cs.RO62

    PRICE:面向具身强化学习的物理关系信用分配方法

    PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。

    推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。

  15. arXiv cs.RO62

    HIDE 基准与 SEEK 框架:面向部分可观测机器人操作的技能级记忆评测与增强

    作者提出 HIDE 基准,用于评测部分可观测条件下的机器人操作记忆,包含重复计数、历史状态回忆和执行进度跟踪三类共 15 项任务,并设置随机初始配置与需依据先前事件区分动作的决策点。

    推荐理由:论文给出部分可观测操作记忆的评测基准与三种记忆机制组合方案,并附仿真与真机对比结果。

  16. arXiv cs.RO62

    DODGER:面向动态障碍物导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。

    推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。

  17. arXiv cs.RO62

    TRACE:自遮挡密集杂乱场景下计划条件模仿的鲁棒取物

    TRACE 是一个面向自遮挡下密集杂乱取物的计划条件模仿框架,用单张无遮挡观测初始化数字孪生,由特权教师生成固定标称 rollout,循环学生结合局部 rollout 上下文、部分物体观测和本体感知选择动作以纠正偏差。

    推荐理由:论文给出自遮挡下密集杂乱取物的计划条件模仿方法,含仿真与 UR5e 真机成功率及执行时间对比。

  18. arXiv cs.RO62

    Online-ES:通过自监督轨迹分布优化在线进化 Flow Matching VLA 策略

    论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。

    推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。

  19. arXiv cs.RO62

    基于运动策略的人形机器人足球:多方向踢球技能库的任务门控强化学习

    研究提出一种倒置的堆叠方式,先训练通用的指令条件化运动策略作为底层,再在其上叠加 N 个运动引导的踢球技能作为任务门控层,使可达步态空间由运动课程而非参考片段决定。

    推荐理由:论文把运动策略作为底层、踢球技能作为任务门控层,并给出多方向射门与地形、推力恢复的评测结果。

  20. arXiv cs.RO62

    CEER2:面向人形机器人移动操作的方向可调末端执行器与根部柔顺框架

    CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。

    推荐理由:论文提出人形机器人末端执行器与根部的方向可调柔顺框架,读者可了解分层强化学习如何调制全身跟踪策略。