跳到正文

仿真与迁移

追踪仿真与迁移的研究、可复用工程方法与真实部署证据。

51条精选

最新精选

第 1–20 条 · 共 51 条
今天10月1日周四
  1. arXiv cs.RO62

    OccluDex:面向自遮挡下第一视角灵巧操作的分层三维视触觉表征学习

    OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。

    推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。

  2. arXiv cs.RO62

    FunCo-Grasp:面向跨本体灵巧抓取生成的功能对应方法

    FunCo-Grasp 通过功能部件对齐与规范坐标系对齐,在不同结构机械手之间建立功能对应,使模型学习可迁移的抓取知识。在过滤后 CMapDataset 的留出物体仿真中,三只已见手平均成功率 92.40%,四只未见手 74.02%;真机实验中同一模型在两只未见手上取得 76.00% 的总体成功率,无需额外训练或微调。

    推荐理由:论文提出跨本体灵巧抓取的功能对应方法,读者可了解无需目标手抓取数据即可迁移到未见手的思路与仿真真机结果。

  3. arXiv cs.RO62

    NEXUS:面向地形自适应遥操作的感知全身控制框架

    NEXUS 是一个感知全身控制框架,将人类动作指令与机器人本体感知反馈结合,使机器人在与操作者地形不一致时仍能复现行为。作者提出可扩展的地形自适应算法,无需逐动作或逐地形调参即可生成高质量配对动作,并构建近 1000 小时的配对动作语料,通过教师-学生学习训练控制器。实验显示 NEXUS 在评测基准上优于现有全身控制器,并实现零样本真机部署,在多种未见地形上完成实时全身遥操作。

    推荐理由:论文提出跨地形全身遥操作框架,用近1000小时配对动作数据训练感知控制器,并给出零样本真机部署结果。

  4. arXiv cs.RO71

    SimEX:仿真集成的机器人自动研究框架

    SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。

    推荐理由:论文提出仿真与编码智能体结合的自动研究框架,读者可了解无示范条件下获取真机操作技能的两阶段方法。

  5. arXiv cs.RO60

    Video2SwimFish:从真实鱼视频重建可控鱼模型与生物运动

    Video2SwimFish 提出一套自动化流程与基准,从真实鱼的多视角同步视频重建带尺度形变网格,通过 VLM actor-critic 循环生成适配个体形态的内部关节,并从观测到的中线曲率提取 Biological Locomotion Manifold(BLM),作为受真实鱼运动约束的低维动作空间,为每条重建鱼学习个体游动策略。

    推荐理由:论文公开了从真实鱼视频重建可控游动资产的数据集与基准,并指出任务成功率与个体运动保真度并不一致。

  6. arXiv cs.RO71

    EmbodiRSI:面向数据高效机器人适配的递归自改进系统

    EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。

    推荐理由:论文给出真实到仿真再回真实的递归自改进流程,读者可了解用少量真机轨迹完成策略适配的具体做法。

  7. arXiv cs.RO62

    HIDE 基准与 SEEK 框架:面向部分可观测机器人操作的技能级记忆评测与增强

    作者提出 HIDE 基准,用于评测部分可观测条件下的机器人操作记忆,包含重复计数、历史状态回忆和执行进度跟踪三类共 15 项任务,并设置随机初始配置与需依据先前事件区分动作的决策点。

    推荐理由:论文给出部分可观测操作记忆的评测基准与三种记忆机制组合方案,并附仿真与真机对比结果。

  8. arXiv cs.RO62

    DODGER:面向动态障碍物导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。

    推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。

  9. arXiv cs.RO62

    TRACE:自遮挡密集杂乱场景下计划条件模仿的鲁棒取物

    TRACE 是一个面向自遮挡下密集杂乱取物的计划条件模仿框架,用单张无遮挡观测初始化数字孪生,由特权教师生成固定标称 rollout,循环学生结合局部 rollout 上下文、部分物体观测和本体感知选择动作以纠正偏差。

    推荐理由:论文给出自遮挡下密集杂乱取物的计划条件模仿方法,含仿真与 UR5e 真机成功率及执行时间对比。

  10. arXiv cs.RO62

    CEER2:面向人形机器人移动操作的方向可调末端执行器与根部柔顺框架

    CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。

    推荐理由:论文提出人形机器人末端执行器与根部的方向可调柔顺框架,读者可了解分层强化学习如何调制全身跟踪策略。

  11. arXiv cs.RO62

    DTMR:面向腿足机器人的稠密时序动作重定向

    作者提出稠密时序动作重定向(DTMR),在单个优化中联合优化时序与控制,对每个控制步调整时序,并用基于采样的 MPC 在 GPU 上并行求解。在四款人形机器人、两小时人体动作数据上评测,DTMR 优于基线,尤其在跳跃等动态动作上;相同形变预算下比优化时间维度的基线重定向更精确且快约 19 倍。用其参考动作训练的策略已迁移到真实人形机器人。

    推荐理由:提出在单个优化中联合调整时序与控制的稠密时序动作重定向方法,读者可了解动态动作迁移的精度与速度权衡。

  12. arXiv cs.RO62

    L1-MPPI:面向敏捷无人机控制的 L1 自适应模型预测路径积分

    论文提出 L1-MPPI,将 L1 自适应控制与模型预测路径积分(MPPI)级联,用于提升高速无人机轨迹跟踪精度。该方法在 MPPI 的动态模型中纳入底层飞行控制器与电机动力学,并加入迭代混合方案,以应对模型不确定性和外部扰动。

    推荐理由:论文把 L1 自适应控制与 MPPI 级联,给出负载扰动下的跟踪误差对比数据,可参考其控制架构与实验设置。

  13. arXiv cs.RO62

    PneuTac:用统一 MPM-高斯泼溅仿真实现软体气动机器人触觉操作

    PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。

    推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。

  14. arXiv cs.RO66

    Fiatlux:面向人形机器人爬梯与换灯泡的长时程基准

    Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。

    推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。

  15. arXiv cs.RO60

    螺旋软体机器人全身抓取与抛掷的优化学习精炼框架

    研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。

    推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。

9月30日周三
  1. arXiv cs.RO62

    受被动动态行走启发的动力学引导方法提升人形机器人行走能效

    该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。

    推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。

  2. arXiv cs.RO62

    SCOUT:用动作-结果反馈实现测试时策略自适应

    SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。

    推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。

  3. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

9月29日周二
  1. HF blog60

    strands-robots 用 Isaac Lab 训练宇树 Go2 并录制 LeRobot 数据集

    strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。

    推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。

  2. HF blog62

    strands 发布 Isaac Lab Shadow Hand 手中方块重定向 PPO 策略

    cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。

    推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。