TeV:面向生成式机器人策略的时序动作验证框架
论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。
推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。
论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。
推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。
TRACE 是一个面向自遮挡下密集杂乱取物的计划条件模仿框架,用单张无遮挡观测初始化数字孪生,由特权教师生成固定标称 rollout,循环学生结合局部 rollout 上下文、部分物体观测和本体感知选择动作以纠正偏差。
推荐理由:论文给出自遮挡下密集杂乱取物的计划条件模仿方法,含仿真与 UR5e 真机成功率及执行时间对比。
Diffusion-2BC 将扩散去噪目标与辅助确定性行为克隆损失结合在共享视觉编码器上,辅助分支仅用于训练,推理仍基于扩散。在 Claw 任务中,其平均掩码距离误差较扩散行为克隆基线降低约 10%,较标准确定性行为克隆降低 85%;在 CARLA 无路线导航中,于 Town01 和 Town02 均比两个基线行驶更远。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
GestAdapt 是一个以预设腕部工作空间为条件的共语手势生成框架,从六个共语语料库学习共享运动表示,并支持重定向到不同机器人本体。用户研究中,修改工作空间约束下生成的手势平均质量得分为 3.24/5,高于无工作空间变体(2.43/5),低于参考动作(3.68/5)。在 Reachy2 人形机器人真机评测中,该框架生成的动作在 69.7% 的对比中排名第一。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
Hugging Face 上线数据集 leapshared/SciEdu_3exp_374epi,由 LeRobot 生成,采用 v3.0 格式,含 374 条 episode、440776 帧、16 个任务,机器人类型为 bi_openarm_follower。
Hugging Face Hub 上线 toniotgz/act_pick_box,这是一个用 LeRobot 0.6.2 训练的 ACT 模仿学习策略,在 so_follower 机器人上执行“从桌上拿起盒子”任务。
Hugging Face 上线 TheBobTheBlob/so101_pickplace_v1 数据集,由 LeRobot 生成,面向 so101_follower 机器人,含 30 条 episode、12029 帧、1 个任务、60 段视频,30 fps,动作与状态均为 6 维关节位置。
Hugging Face 用户 TheBobTheBlob 发布 act_so101_pickplace_v1,这是一个用 LeRobot 训练并上传至 Hub 的 ACT(Action Chunking with Transformers)模仿学习策略,从遥操作数据中学习预测短动作块。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
Hugging Face 用户 castanetnicolas 发布基于 ACT 模仿学习方法的 UR5e 抓取放置策略,使用 LeRobot 0.6.1 训练并推送至 Hub。
Hugging Face 上发布了一个基于 ACT(Action Chunking with Transformers)的 UR5e 抓取放置策略,用 LeRobot 0.6.1 训练并推送至 Hub。
Hugging Face 上发布 ResidentEvian/hf_act_recordpolicy0,这是一个用 LeRobot 0.6.2 训练的 ACT(Action Chunking with Transformers)模仿学习策略,机器人类型为 so_follower,输入 6 维状态与 480×640 前视图像,输出 6 维动作。
Hugging Face 上线 nakanakagawa/sponge_task_9_30_v2 数据集,由 LeRobot 生成,机器人类型为 so_follower,共 6 条 episode、2395 帧、1 个任务,帧率 20 fps,采用 codebase_version v3.0。
Hugging Face 上线数据集 ujheo/pen6_20260930_173022,由 LeRobot 生成,采用 v3.0 数据格式,机器人类型为 so_follower。该数据集含 5 个 episode、3191 帧、1 个任务,以 30 fps 记录 6 自由度动作与状态,并配 front、top 两路 480×640 AV1 视频。
Hugging Face Hub 上线 karrlleereal/omx_act_policy5,这是一个用 LeRobot 训练并推送的 ACT(Action Chunking with Transformers)模仿学习策略,从遥操作数据中学习、预测短动作块而非单步动作。
Hugging Face 上发布 ssdunit/act_abc_sim_lego_sorting_100k,这是一个用 LeRobot 0.6.1 训练的 ACT 模仿学习策略,任务为 lego_blocks_sorting。
Hugging Face 上出现一个用 LeRobot 训练并推送至 Hub 的 ACT(Action Chunking with Transformers)模仿学习策略,它从遥操作数据学习,预测短动作块而非单步动作。该策略采用 apache-2.0 许可,可用 lerobot-train 从零训练,并用 lerobot-record 配合 so100_follower 机器人本体运行推理与评估。
CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。
推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。
Hugging Face 上发布了一个基于 ACT(Action Chunking with Transformers)的 UR5e 模仿学习策略,用 LeRobot 0.6.1 训练,任务是把方形螺母装到方形销上。该策略使用 100 条遥操作数据(24602 帧、20 FPS)训练 10 万步,输入两路 84×84 图像和 9 维状态,输出 7 维动作,目前尚未提供评测结果。
Hugging Face 上线 nakanakagawa/sponge_task_9_29_v4 数据集,由 LeRobot 生成,机器人类型为 so_follower,共 8 条 episode、3192 帧、1 个任务,帧率 20 fps,采用 codebase_version v3.0。
Hugging Face Hub 上线 Tridex/model_act_3cam_resnet_100K_29_09_v2,这是一个用 LeRobot 0.6.2 训练的 ACT 模仿学习策略,面向 so_follower 机器人,配 front、side、top 三路摄像头,输入 6 维状态、输出 6 维动作。
Hugging Face 上线数据集 jetsonmom/omx_yellow_bear_box_2cam,由 LeRobot 生成,机器人类型为 omx_follower,含 20 条 episode、7043 帧、40 段视频,30 fps,动作与状态均为 6 自由度。
Hugging Face 上线 so-arm101-stack-green 数据集,由 LeRobot 生成,采用 codebase_version v3.0,机器人类型为 so_follower。数据集含 40 条 episode、32712 帧、1 个任务,30 fps,记录 6 自由度关节位置与前置、腕部两路 480×640 视频,全部划为训练集。
Hugging Face 上线 nakanakagawa/sponge_task_9_29 数据集,由 LeRobot 生成,采用 v3.0 代码库版本,机器人类型为 so_follower。数据集含 4 条 episode、1596 帧、1 个任务,20 FPS,动作与状态均为 6 维关节位置,配 cam_0、cam_1 两路 480×640 视频。
Hugging Face 上发布了一个名为 krish5831/act_tissues_into_box 的 ACT 模仿学习策略,用 LeRobot 0.6.2 训练,可让 so_follower 机器人完成“把纸巾包放进盒子”的任务。
Hugging Face 上线扩散策略模型 bk912/dp_green_cube_to_box_clean_20k,用 LeRobot 0.6.2 训练,基于 50 条、38140 帧、30 FPS 的 so_follower 机器人数据,训练 20000 步、批量 32。
Hugging Face 上线 LeRobot 数据集 zhniu/lerobot_zihao_dataset_a_20260927_202323,含 40 个 episode、12000 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线数据集 Fabyo04/so101_cube_demo_0_20260926_155239,由 LeRobot 生成,机器人类型为 so_follower,共 100 条 episode、44553 帧、1 项任务,采用 v3.0 代码库、30 fps。
Hugging Face 上出现一个用 LeRobot 创建、代号 my_pick_test_color 的机器人抓取数据集,采用 v3.0 代码库版本,共 30 条 episode、6750 帧、1 个任务,机器人类型为 so_follower。
Hugging Face 上线 leoliu49/pick-cap-tactile 数据集,用 SO-101 的 so_follower 本体采集“抓住瓶盖,抓空就重试”任务。
Hugging Face 上线机器人数据集 leoliu49/pick-cap-notactile,含 39 条 SO-101(so_follower)示范,任务为“抓住瓶盖拿起瓶子,没抓中就重试”。
亮源新创9月21日发布技术博客,披露Light-O1人类动作预训练规模从37.5亿扩展到1200亿token(最大约对应10万小时人类动作),在第一视角人类数据、公开机器人数据和自研人形机器人数据上适配后,动作预测误差、全身姿态误差和腕部位置误差均持续下降并呈幂律趋势,被其称为迁移缩放定律。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
Hugging Face 上线论文页《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,探讨在策略修正对较弱模型的提升作用。论文指出,在模仿学习失效的场景下,该方法能帮助弱模型追赶。
国内创业公司可可矩阵(COCO Matrix)正把In-Context Learning做成具身智能的底层范式,思路是将后训练的ICL前置到预训练阶段。创始人高宇翔称核心团队到齐后不到一个月即拿到验证技术方案可行性的核心证据,其条件表征模型已在八九类视觉任务上验证,动作头压到约60M参数效果依然可用。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
东北大学 SV 机器人 SIG 的 Team TRON 在 Φ 硬件智能 ACT 训练竞赛中提交了 tavishh/robotarm:基于 phi_so101_cubes_cylinder_v1 数据集(120 条轨迹、66,873 帧、3 路相机)训练的 ACT(CVAE)策略,用于抓取方块或圆柱并放入盒中。