跳到正文

视觉语言动作模型

追踪视觉语言动作模型的研究、可复用工程方法与真实部署证据。

54条精选

最新精选

第 1–20 条 · 共 54 条
今天10月1日周四
  1. arXiv cs.RO62

    SteerQuant:用动作引导缩放控制世界动作模型的量化误差

    SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。

    推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。

  2. arXiv cs.RO62

    TeV:面向生成式机器人策略的时序动作验证框架

    论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。

    推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。

  3. arXiv cs.RO66

    URAI:让前沿智能体编写、调用并演化机器人工具

    论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。

    推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。

  4. arXiv cs.RO62

    Cue the Flow:用空间线索引导流匹配策略完成开放世界配送操作

    论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。

    推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。

  5. arXiv cs.RO62

    Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

    Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

    推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。

  6. arXiv cs.RO66

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉

    研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。

    推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。

  7. arXiv cs.RO62

    PRICE:面向具身强化学习的物理关系信用分配方法

    PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。

    推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。

  8. arXiv cs.RO62

    Online-ES:通过自监督轨迹分布优化在线进化 Flow Matching VLA 策略

    论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。

    推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。

  9. arXiv cs.RO66

    BIND:将 3D 机器人动作绑定到 2D 图像特征的动作表示

    作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。

    推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。

  10. arXiv cs.RO62

    Memorize, Adapt, Ignore:诊断训练数据变化下的机器人学习机制

    该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。

    推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。

  11. arXiv cs.RO66

    Fiatlux:面向人形机器人爬梯与换灯泡的长时程基准

    Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。

    推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。

9月30日周三
  1. arXiv cs.RO71

    KPI:面向人形机器人物理交互的可提示内核

    论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。

    推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。

  2. arXiv cs.RO62

    机器人上下文学习综述:方法与应用

    一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。

    推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。

  3. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  4. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

9月21日周一
  1. qbitai81

    清华、无问芯穹等开源具身智能体基础设施 RPent

    清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。

    推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。

9月14日周一
  1. qbitai78

    生数科技发布世界模型 Motus2,探索机器人自我进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。

    推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。

9月12日周六
  1. qbitai78

    生数发布世界模型 Motus2,探索机器人闭环自进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。

    推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。

9月11日周五
  1. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。