SteerQuant:用动作引导缩放控制世界动作模型的量化误差
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。
推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
OccluDex 是一个分层三维视触觉表征学习框架,将全局几何结构与局部接触信息结合,用于手物交互中动态自遮挡下的灵巧操作。它采用多尺度掩码自编码逐步编码部分三维几何,并通过跨模态注意力将触觉接触 token 与高层几何特征融合,编码器由同步的人类视触觉示范预训练,再作为冻结感知主干迁移到下游强化学习。
推荐理由:提出分层三维视触觉表征框架,用多尺度掩码自编码与跨模态注意力应对自遮挡下的灵巧操作。
NEXUS 是一个感知全身控制框架,将人类动作指令与机器人本体感知反馈结合,使机器人在与操作者地形不一致时仍能复现行为。作者提出可扩展的地形自适应算法,无需逐动作或逐地形调参即可生成高质量配对动作,并构建近 1000 小时的配对动作语料,通过教师-学生学习训练控制器。实验显示 NEXUS 在评测基准上优于现有全身控制器,并实现零样本真机部署,在多种未见地形上完成实时全身遥操作。
推荐理由:论文提出跨地形全身遥操作框架,用近1000小时配对动作数据训练感知控制器,并给出零样本真机部署结果。
论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。
推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。
Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。
推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。
SimEX 是一个将仿真实验与编码智能体结合的自动研究框架,分两阶段让智能体先在仿真中开放式试错并构建机器人工具箱,再通过少量真机试验校正仿真器并筛选修复方案。在毛巾折叠、条码扫描和盘子操作等真机操作任务上,SimEX 无需任何示范、仅用 10 分钟真机交互即可让编码智能体获得机器人技能。作者认为仿真不仅是训练数据来源,也可作为编码智能体发展机器人知识与操作流程的实验室。
推荐理由:论文提出仿真与编码智能体结合的自动研究框架,读者可了解无示范条件下获取真机操作技能的两阶段方法。
Video2SwimFish 提出一套自动化流程与基准,从真实鱼的多视角同步视频重建带尺度形变网格,通过 VLM actor-critic 循环生成适配个体形态的内部关节,并从观测到的中线曲率提取 Biological Locomotion Manifold(BLM),作为受真实鱼运动约束的低维动作空间,为每条重建鱼学习个体游动策略。
推荐理由:论文公开了从真实鱼视频重建可控游动资产的数据集与基准,并指出任务成功率与个体运动保真度并不一致。
研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。
推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。
EmbodiRSI 是一个在真实到仿真再回真实流程中做递归自改进的智能体系统,用任务专属仿真作为低成本环境迭代改进策略后再迁回真机。在三个桌面环境和 14 个子任务上,经过两轮 RSI 更新,场景均衡的自主仿真成功率从 50.4% 提升到 83.5%。
推荐理由:论文给出真实到仿真再回真实的递归自改进流程,读者可了解用少量真机轨迹完成策略适配的具体做法。
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
作者提出 HIDE 基准,用于评测部分可观测条件下的机器人操作记忆,包含重复计数、历史状态回忆和执行进度跟踪三类共 15 项任务,并设置随机初始配置与需依据先前事件区分动作的决策点。
推荐理由:论文给出部分可观测操作记忆的评测基准与三种记忆机制组合方案,并附仿真与真机对比结果。
研究者提出 EMPlan,一种由奖励引导微调驱动的高效多模态轨迹规划方法,采用稀疏锚点加偏移精修模块的混合架构,稀疏锚点以低时延给出粗轨迹候选,再由偏移模块精修提升精度。方法采用预训练加奖励引导微调的两阶段训练,利用规则奖励信号与非成对偏好监督,在不增加推理成本的前提下提升安全性。在非反应式 NAVSIM 基准上,EMPlan 在实时约束下兼顾了规划精度与效率。
论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。
推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。
FlapKAD 是一个面向扑翼飞行器的仿真数据集,包含 2000 个刚性翼飞行片段和 720152 个有效时间步,在同一时钟下同步记录双侧机翼运动学、气动响应与飞行状态。
TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。
Yggdrasil 是一个面向机器人感知的层优先分层3D场景图,用通用节点、边和层表达现有管线已产出的室内外、扁平或分层表示,并原生回答下游任务的位置与语义查询。
推荐理由:论文提出面向实时查询优化的分层3D场景图,并给出查询延迟与三条感知管线的集成数据。
研究提出 Referential Guidance(ReGuide),一种免训练包装器,依据 grounding 模块给出的物体位姿,结合语义与几何重绑定,引导末端执行器进入示范支持的配置,让冻结策略继续执行。仿真中跨多个 VLA 主干及真机实验显示,ReGuide 在组合偏移下成功率分别最高提升 56.8 和 75.0 个百分点,同时保持标准任务性能。
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
论文提出一种技能条件表征,让查询到的技能对模态特定的短期观测 token 进行融合,并关注保留最近 K 个已执行技能终末观测的稀疏事件记忆。在三个接触密集任务上以技能进度估计评估,滑移检测延迟较微调 SOTA 进度模型降低 87%,扭转完成延迟较纯视觉消融降低 67.5%,盲搜索任务的进度误差通过稀疏事件记忆降低 92%。作者认为观测构建而非仅策略架构是多模态表征的核心挑战。
TrafficSignBench 是一个以交通标志为中心的大规模基准,用于系统且可解释地评测自动驾驶规划器的交通规则合规性。该框架结合真实地图仿真与规则定向的程序化场景生成,实现 34 类交通标志对应规则的自动违规检查,产出 29,000 个道路场景和 29 种测试场景类型,并构建 5,800 个测试场景。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
PneuTac 提出一个面向软体气动机器人触觉反馈操作的统一仿真框架,用物质点法(MPM)建模软体机器人与可变形触觉膜动力学,用 3D 高斯泼溅(3DGS)做渲染,并通过基于视觉的简单方法完成真实到仿真建模,再训练动作与感知网络作为代理模型加速仿真。
推荐理由:提出软体气动机器人与触觉传感的统一仿真框架,为触觉操作策略的仿真增强训练提供可复用思路。
作者提出参数化生成工具 Draft,其通用引擎可将任意串行链参数树编译为可直接仿真的 MJCF 模型,无需 CAD。Draft 用对 114 个执行器和 49 份已发表机器人描述的调研拟合趋势来约束设计自由参数,并通过构建四款现成机器人的数字孪生验证,质量几何平均折叠误差为 1.10 倍。作者还用两阶段强化学习课程评估三款四足机器人,展示该工具如何呈现设计权衡。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
GestAdapt 是一个以预设腕部工作空间为条件的共语手势生成框架,从六个共语语料库学习共享运动表示,并支持重定向到不同机器人本体。用户研究中,修改工作空间约束下生成的手势平均质量得分为 3.24/5,高于无工作空间变体(2.43/5),低于参考动作(3.68/5)。在 Reachy2 人形机器人真机评测中,该框架生成的动作在 69.7% 的对比中排名第一。
作者提出 TALK-Dem,首个评估 LLM 驱动机器人任务规划在痴呆症相关言语沟通下表现的基准,包含 4,800 条指令,覆盖指代不精确、对象替换、空语、话题漂移和侵入五种沟通模式及三个强度等级。
推荐理由:论文给出面向痴呆症沟通模式的机器人任务规划基准与检索式缓解方法,可了解辅助机器人在非理想指令下的鲁棒性缺口。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
Hugging Face 上线 leapshared 的 Redox_130epi_new_20260928_145214 数据集,由 LeRobot 生成,采用 v3.0 代码库,含 131 条 episode、154675 帧、1 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线数据集 leapshared/SciEdu_3exp_374epi,由 LeRobot 生成,采用 v3.0 格式,含 374 条 episode、440776 帧、16 个任务,机器人类型为 bi_openarm_follower。
Hugging Face 上线数据集 Jianguo-Huang11/APM-Bench。该数据集页面未提供更多说明,仅附有 Hugging Face 推进开源与开放科学、推动人工智能民主化的使命表述。
Hugging Face 上线 TheBobTheBlob/so101_pickplace_v1 数据集,由 LeRobot 生成,面向 so101_follower 机器人,含 30 条 episode、12029 帧、1 个任务、60 段视频,30 fps,动作与状态均为 6 维关节位置。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
Hugging Face 上出现由 LeRobot 生成的 UR5e 螺母装配数据集,含 100 条 episode、24602 帧、1 个任务,机器人类型为 ur5e。数据以 20 fps 采集,动作维度 7、状态维度 9,配两路 84×84 视频,采用绝对动作与 OSC_POS 控制,训练集划分 0:100。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
SCOUT 是一个动力学感知的元学习框架,通过共享信念隐空间把动作预测策略与前向动力学模型耦合,让操作策略在部署时依据动作-结果偏差在线更新内部信念,从而适应未知物理动力学。论文称该方法在仿真操作基准上显著加快在线自适应,并实现了真实世界的仿真到真实迁移,已被 CoRL 2026 接收。
推荐理由:提出用动作-结果反馈在线更新动力学信念的元学习框架,读者可了解测试时自适应如何绕开稀疏奖励。
Hugging Face 上线 nakanakagawa/sponge_task_9_30_v2 数据集,由 LeRobot 生成,机器人类型为 so_follower,共 6 条 episode、2395 帧、1 个任务,帧率 20 fps,采用 codebase_version v3.0。
Hugging Face 上线数据集 ujheo/pen6_20260930_173022,由 LeRobot 生成,采用 v3.0 数据格式,机器人类型为 so_follower。该数据集含 5 个 episode、3191 帧、1 个任务,以 30 fps 记录 6 自由度动作与状态,并配 front、top 两路 480×640 AV1 视频。