跳到正文

#VLA

今日 17 条
今天10月1日周四
  1. arXiv cs.RO62

    SteerQuant:用动作引导缩放控制世界动作模型的量化误差

    SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。

    推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。

  2. arXiv cs.RO62

    TeV:面向生成式机器人策略的时序动作验证框架

    论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。

    推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。

  3. arXiv cs.RO66

    URAI:让前沿智能体编写、调用并演化机器人工具

    论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。

    推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。

  4. arXiv cs.RO62

    Cue the Flow:用空间线索引导流匹配策略完成开放世界配送操作

    论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。

    推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。

  5. arXiv cs.RO62

    Sparse-WAM:用动作引导稀疏想象加速世界动作模型推理

    Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。

    推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。

  6. arXiv cs.RO66

    DrivingBench:视觉语言模型能否驾驶丰田卡罗拉

    研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。

    推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。

  7. arXiv cs.RO62

    PRICE:面向具身强化学习的物理关系信用分配方法

    PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。

    推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。

  8. arXiv cs.RO62

    Online-ES:通过自监督轨迹分布优化在线进化 Flow Matching VLA 策略

    论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。

    推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。

  9. arXiv cs.RO58

    ReGuide:免训练包装器提升 VLA 组合泛化能力

    研究提出 Referential Guidance(ReGuide),一种免训练包装器,依据 grounding 模块给出的物体位姿,结合语义与几何重绑定,引导末端执行器进入示范支持的配置,让冻结策略继续执行。仿真中跨多个 VLA 主干及真机实验显示,ReGuide 在组合偏移下成功率分别最高提升 56.8 和 75.0 个百分点,同时保持标准任务性能。

  10. arXiv cs.RO55

    技能条件视觉触觉表征与进度引导事件记忆:按技能融合视觉与触觉

    论文提出一种技能条件表征,让查询到的技能对模态特定的短期观测 token 进行融合,并关注保留最近 K 个已执行技能终末观测的稀疏事件记忆。在三个接触密集任务上以技能进度估计评估,滑移检测延迟较微调 SOTA 进度模型降低 87%,扭转完成延迟较纯视觉消融降低 67.5%,盲搜索任务的进度误差通过稀疏事件记忆降低 92%。作者认为观测构建而非仅策略架构是多模态表征的核心挑战。

  11. arXiv cs.RO66

    BIND:将 3D 机器人动作绑定到 2D 图像特征的动作表示

    作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。

    推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。

  12. arXiv cs.RO62

    Memorize, Adapt, Ignore:诊断训练数据变化下的机器人学习机制

    该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。

    推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。

  13. arXiv cs.RO66

    Fiatlux:面向人形机器人爬梯与换灯泡的长时程基准

    Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。

    推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。

  14. TechCrunch robotics42

    Destro AI 用智能层让机器人与人类协同,获 800 万美元种子轮

    Destro 结束隐身状态并获得 800 万美元种子轮融资,其 AI 智能层让机器人在物流场景中与人类协同作业。该公司在 Yusen Logistics 位于美国西北部的一处设施试点,用三台 Miva Robotics 搬运机器人配合 Vision 操作系统完成跨库装卸,现扩展至 26 台机器人部署,并在南加州启动 17 台机器人的新试点。

9月30日周三
  1. qbitai74

    斯坦福 HomeBody 让 GPT-6 Astra 调度宇树 G1 收拾厨房

    斯坦福团队项目 HomeBody 让 GPT-6 Astra 接入宇树 G1,在陌生厨房中按语言指令收拾物品、丢纸盒并从抽屉取药。系统先让 G1 探索建图,再由 Astra 作为 Real2Sim 智能体在 Isaac Sim 中重建数字厨房,之后由 Astra 调用导航、抓取、放置、开抽屉等可复用技能,底层用预训练 AMO 控制策略协调行走与操作。

  2. arXiv cs.RO71

    KPI:面向人形机器人物理交互的可提示内核

    论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。

    推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。

  3. arXiv cs.RO62

    机器人上下文学习综述:方法与应用

    一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。

    推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。

  4. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  5. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

9月29日周二
9月28日周一
9月26日周六
  1. qbitai66

    美梦空间联合索辰科技发布Physical-WAM世界动作模型与RoboTwin-Phys物理漂移评测基准

    9月26日,杭州美梦空间在第五届全球数字贸易博览会上发布Physical-WAM物理-世界动作模型与RoboTwin-Phys物理漂移评测基准。Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,在感知输入与动作输出之间插入物理Token表征,用于估计摩擦、重量、重心、接触状态等物理信息并预判动作后果。

9月24日周四
  1. qbitai62

    灵初智能发布 Psi-R2.5,用强配对数据改进人机动作对齐

    灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。

9月21日周一
  1. qbitai81

    清华、无问芯穹等开源具身智能体基础设施 RPent

    清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。

    推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。

9月17日周四
9月16日周三
9月15日周二
9月14日周一
  1. qbitai40

    首届蚂蚁灵波具身大模型挑战赛启动,基于 LingBot-VLA 2.0

    首届蚂蚁灵波具身大模型挑战赛在外滩大会启动,由蚂蚁灵波、魔搭社区和阿里云天池共同发起,以 2026 年 7 月开源的 LingBot-VLA 2.0 预训练模型为技术基座,面向全球开发者开放。大赛报名及线上初赛持续至 10 月 26 日,初赛设必做的 RoboTwin 2.0 仿真任务和可选真机创新任务,入围团队将于 11 月 13 日至 15 日在上海参加线下真机黑客马拉松。

  2. qbitai78

    生数科技发布世界模型 Motus2,探索机器人自我进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。

    推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。

9月12日周六
  1. qbitai78

    生数发布世界模型 Motus2,探索机器人闭环自进化

    生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。

    推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。

9月11日周五
  1. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。