跳到正文

#模仿学习

今日 7 条
今天10月1日周四
  1. arXiv cs.RO62

    TeV:面向生成式机器人策略的时序动作验证框架

    论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。

    推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。

  2. arXiv cs.RO62

    TRACE:自遮挡密集杂乱场景下计划条件模仿的鲁棒取物

    TRACE 是一个面向自遮挡下密集杂乱取物的计划条件模仿框架,用单张无遮挡观测初始化数字孪生,由特权教师生成固定标称 rollout,循环学生结合局部 rollout 上下文、部分物体观测和本体感知选择动作以纠正偏差。

    推荐理由:论文给出自遮挡下密集杂乱取物的计划条件模仿方法,含仿真与 UR5e 真机成功率及执行时间对比。

  3. arXiv cs.RO43

    Diffusion-2BC:混合扩散与回归训练用于自动驾驶离线行为克隆

    Diffusion-2BC 将扩散去噪目标与辅助确定性行为克隆损失结合在共享视觉编码器上,辅助分支仅用于训练,推理仍基于扩散。在 Claw 任务中,其平均掩码距离误差较扩散行为克隆基线降低约 10%,较标准确定性行为克隆降低 85%;在 CARLA 无路线导航中,于 Town01 和 Town02 均比两个基线行驶更远。

  4. arXiv cs.RO62

    Memorize, Adapt, Ignore:诊断训练数据变化下的机器人学习机制

    该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。

    推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。

  5. arXiv cs.RO41

    GestAdapt:面向人形机器人的工作空间条件化共语手势生成

    GestAdapt 是一个以预设腕部工作空间为条件的共语手势生成框架,从六个共语语料库学习共享运动表示,并支持重定向到不同机器人本体。用户研究中,修改工作空间约束下生成的手势平均质量得分为 3.24/5,高于无工作空间变体(2.43/5),低于参考动作(3.68/5)。在 Reachy2 人形机器人真机评测中,该框架生成的动作在 69.7% 的对比中排名第一。

  6. arXiv cs.RO60

    SynIL:利用运动协同度从不完美示范数据集中做离线模仿学习

    SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。

    推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。

9月30日周三
  1. arXiv cs.RO62

    SAKI:从人类视频组装技能并做运动学模仿,实现长时程移动操作

    SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。

    推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。

  2. HF blog66

    CrossBFM:跨人形本体蒸馏共享潜行为空间

    CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。

    推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。

9月29日周二
  1. HF blog22

    castanetnicolas 的 ACT UR5e 方形螺母装配策略上线 Hugging Face

    Hugging Face 上发布了一个基于 ACT(Action Chunking with Transformers)的 UR5e 模仿学习策略,用 LeRobot 0.6.1 训练,任务是把方形螺母装到方形销上。该策略使用 100 条遥操作数据(24602 帧、20 FPS)训练 10 万步,输入两路 84×84 图像和 9 维状态,输出 7 维动作,目前尚未提供评测结果。

9月28日周一
9月27日周日
9月26日周六
9月24日周四
9月23日周三
  1. qbitai74

    刷视频也能教会机器人干活:1200亿tokens人类动作预训练,误差按幂律下降

    亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。

9月21日周一
9月10日周四
9月6日周日
  1. qbitai44

    可可矩阵高宇翔:把具身ICL前置到预训练,押注上下文Scaling新赛道

    国内创业公司可可矩阵(COCO Matrix)正把In-Context Learning做成具身智能的底层范式,思路是将后训练的ICL前置到预训练阶段。创始人高宇翔称核心团队到齐后不到一个月即拿到验证技术方案可行性的核心证据,其条件表征模型已在八九类视觉任务上验证,动作头压到约60M参数效果依然可用。

8月29日周六
  1. qbitai22

    去年归国的徐梦迪,成了清华姚班班主任

    2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。

8月23日周日
8月7日周五