SteerQuant:用动作引导缩放控制世界动作模型的量化误差
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
SteerQuant 是一个面向世界动作模型(WAM)的 4-bit 量化框架,通过映射各语义流量化误差对最终动作的影响来引导共享通道缩放,并按流和去噪步校准激活缩放。
推荐理由:提出面向世界动作模型的 4-bit 量化框架,把量化误差导向对最终动作影响较小的计算,并给出真机双臂部署结果。
论文提出时序验证(TeV),一种面向流匹配VLA的高效时序感知动作验证框架。TeV先学习一个时序token来概括近期观察与动作历史,使候选动作块作为执行轨迹的延续而非孤立预测被评估;在此基础上无需额外专家示范或偏好标注即可构建正负样本对,对比训练基于能量的验证器,为更高质量、轨迹一致的动作块分配更低能量。
推荐理由:针对生成式机器人策略动作验证的时间短视问题,提出无需额外专家示范的时序验证框架,可供做VLA测试时扩展的读者参考。
论文提出 URAI(Universal Robot-Agent Interface),将编程智能体与执行智能体耦合:前者从任务意图编写可复用和任务专用的机器人工具,并通过执行反馈与人工指导迭代,后者从当前观测选择并参数化这些工具,每次调用在本地完成完整动作后再交回决策权。
推荐理由:论文给出代码作为策略的新分工方式,并附五个仿真任务与七项真机任务的对比数据,可供关注机器人策略设计的研究者参考。
论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。
推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。
Sparse-WAM 是一个免训练框架,通过动作引导的稀疏想象选择性处理未来帧 token,加速世界动作模型(WAM)推理。它基于动作 token 到未来帧注意力在相邻去噪步间空间分布高度重叠的观察,提出 Action-Guided Token Selection 保留动作相关区域与跨帧上下文,并用 Pilot 引擎以轻量打分和跨步复用降低稀疏推理开销。
推荐理由:提出免训练的动作引导稀疏想象框架,在 LIBERO 与 RoboLab-120 上给出约 2 倍推理加速,可迁移到世界动作模型的部署优化。
研究团队提出 DrivingBench,据其所述是首个要求通用视觉语言模型驾驶真车的基准,模型通过三个工具读取丰田卡罗拉的摄像头画面,直接控制转向与速度,在低速停车场锥桶路线中行驶。
推荐理由:读者可了解一个让通用视觉语言模型直接驾驶真车的基准设计,以及延迟与工具格式如何影响模型能否完成长程任务。
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。
推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。
研究提出 Referential Guidance(ReGuide),一种免训练包装器,依据 grounding 模块给出的物体位姿,结合语义与几何重绑定,引导末端执行器进入示范支持的配置,让冻结策略继续执行。仿真中跨多个 VLA 主干及真机实验显示,ReGuide 在组合偏移下成功率分别最高提升 56.8 和 75.0 个百分点,同时保持标准任务性能。
研究提出 adapt-then-steer 策略,将现成驾驶 VLA 适配到 Class 8 卡车:以 NVIDIA Alpamayo 1.5 为基座,仅微调其动作生成部分,使用数百个真实施工与事故相关高速场景。
Galbot 团队在六个领域系统评测 GPT-6 Astra 作为通用具身策略的表现,涵盖直接控制、与学习策略协作和反馈驱动适应。
推荐理由:系统评测 GPT-6 Astra 作为具身策略在六类任务上的表现,并给出成功率与推理延迟数据,可据此判断通用模型与物理控制的差距。
论文提出一种技能条件表征,让查询到的技能对模态特定的短期观测 token 进行融合,并关注保留最近 K 个已执行技能终末观测的稀疏事件记忆。在三个接触密集任务上以技能进度估计评估,滑移检测延迟较微调 SOTA 进度模型降低 87%,扭转完成延迟较纯视觉消融降低 67.5%,盲搜索任务的进度误差通过稀疏事件记忆降低 92%。作者认为观测构建而非仅策略架构是多模态表征的核心挑战。
作者提出 BIND,一种将 3D 机器人动作绑定到对应 2D 图像特征的视觉运动策略动作表示,通过相机几何而非学习来提供动作与特征的关系。它离散化候选末端执行器位置体积,把每个候选与各相机视角投影处的预训练特征关联,再对候选的位置与图像绑定特征组合打分来选动作。在真机上,BIND 在少至 5 次示范的任务上取得接近完美的成功率,并在相机视角大幅偏移和未见物体位置下表现稳健,而坐标回归基线完全失败。
推荐理由:BIND 用相机几何把 3D 动作绑定到 2D 图像特征,读者可了解其数据效率与视角鲁棒性的真机验证方式。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
Fiatlux 是一个基于 NVIDIA Isaac Lab 的长时程基准,让 Unitree G1 人形机器人在一个回合内把梯子放到天花板或墙壁灯具下、爬梯、把灯座里的旧灯泡换成新灯泡,并把旧灯泡放进回收箱。
推荐理由:Fiatlux 把爬梯与换灯泡合成一个长时程基准,并给出十二个子任务与三类基线,可供人形操作评测参考。
NVIDIA 在 CES 上展示 Caterpillar 座舱 AI 助手,基于 Jetson Thor 本地运行 Nemotron 语音模型与 Qwen3 4B,无需云端连接。
Destro 结束隐身状态并获得 800 万美元种子轮融资,其 AI 智能层让机器人在物流场景中与人类协同作业。该公司在 Yusen Logistics 位于美国西北部的一处设施试点,用三台 Miva Robotics 搬运机器人配合 Vision 操作系统完成跨库装卸,现扩展至 26 台机器人部署,并在南加州启动 17 台机器人的新试点。
斯坦福团队项目 HomeBody 让 GPT-6 Astra 接入宇树 G1,在陌生厨房中按语言指令收拾物品、丢纸盒并从抽屉取药。系统先让 G1 探索建图,再由 Astra 作为 Real2Sim 智能体在 Isaac Sim 中重建数字厨房,之后由 Astra 调用导航、抓取、放置、开抽屉等可复用技能,底层用预训练 AMO 控制策略协调行走与操作。
fanqi-robo 在 Hugging Face 发布 π0.5 微调检查点 pi05_insert_gear_in_gripper_b0,基于 lerobot/pi05_base 在 50 集双臂 YAM 插齿轮数据集上全量微调,训练 20k 步、全局 batch 32、lr 2.5e-5,采用 QUANTILES 归一化与绝对关节、3 路相机、无图像增强。
基于 lerobot/smolvla_base 微调的 SmolVLA 策略 mongster7/smolvla_dice_50k 在 LeKiwi 移动机械臂上完成"把红色骰子放进篮子"任务。
论文提出 KPI,一种位于轨迹源与未修改全身跟踪器之间的可提示内核,轨迹源按方向下发跟踪、柔顺或保持力范围的契约,内核依据跟踪误差与力旋量估计在接触频率上调整手臂刚度、阻尼、参考与前馈。作者用视觉语言智能体从单条指令同时生成参考轨迹与契约,无需任务专用代码,演示了绞盘操作、开门和箱子搬运,其中绞盘演示中人形机器人转动曲柄将另一台机器人完全吊离地面。
推荐理由:论文提出在轨迹源与全身跟踪器之间插入可提示内核,读者可了解接触阶段刚度与阻尼如何按指令自适应。
一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。
推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。
论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。
推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。
EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。
推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。
Hugging Face Hub 上线 klinzw/pi05_autolife_fridge,这是基于 Physical Intelligence π₀.₅、用 LeRobot 0.6.0 微调并推送的视觉语言动作策略,机器人本体为 autolife_s1,执行“open fridge”和“close fridge”任务。
ROBOTIS 发布 Mission Canvas,可在地图上定义航点并指定顺序,为每个位置关联一个 Task,使导航与机器人动作作为单个 Mission 执行。
9月26日,杭州美梦空间在第五届全球数字贸易博览会上发布Physical-WAM物理-世界动作模型与RoboTwin-Phys物理漂移评测基准。Physical-WAM由PhysLens、PhysDream、PhysAct三个模块构成,在感知输入与动作输出之间插入物理Token表征,用于估计摩擦、重量、重心、接触状态等物理信息并预判动作后果。
成立三个月的Simate发布首版通用物理快系统Simate-beta,据公司披露以平均Score 33.95、SR 27.96%登顶更新于2026年9月23日的RoboDojo榜单,该成绩属榜单评测,真机表现另行展示。
诺因(Knowin)9月24日发布面向通用具身智能的生成式学习架构 GLOW 技术报告,称人类演示一次后机器人即可跨物体、跨环境、跨任务复用,在开盒收纳、浇水、擦桌、调酒等任务中得到验证。
灵初智能在十万小时级数据基础上发布模型 Psi-R2.5,改进数据质量与人机数据对齐方法。它逆向使用世界模型 Psi-W0,从真实机器人数据生成对应人手操作数据,训练端到端转换器输出匹配的机器人图像和动作,并称转换数据已在真机回放和后训练两类测试中得到验证,部分复杂任务仍未直接完成。
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施 RPent,将通用大模型的任务规划、VLA 等专家模型的动作执行与记忆系统连接成闭环,在 LIBERO-PRO 基准达到 92.6% 任务成功率。
推荐理由:RPent 把大模型规划、VLA 执行与记忆机制串成闭环,并给出 LIBERO-Pro 成功率与 Flash Mode 延时数据,可据此判断分层智能体路线的工程取舍。
Hugging Face Hub 上线 K-vr/cube_stack3_Pi05_abs_batch8,这是基于 Physical Intelligence 的 π₀.₅ 视觉语言动作模型、用 LeRobot 0.6.1 微调并推送的机器人策略,基座为 lerobot/pi05_base。
研究显示,针对视觉语言动作(VLA)模型的后门攻击 BadVLA 可在触发器出现时让机器人动作轨迹产生条件性偏移,无触发器时任务表现基本正常;GoBA 用咖啡杯等普通物体作触发器,报告 97% 攻击成功率且不降低干净输入上的表现。
紫东太初开源通用多模态大模型 ZDTaichu5.0-9B,在九项空间理解基准测试中八项位列 10B 档位第一,MindCube-tiny 得分 78.27,对照的 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.8462、70.87 和 63.56。
无问芯穹联合清华大学、上海交通大学开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等平台,首发支持 PI 0.5 与 WALL-OSS 两款具身模型。
首届蚂蚁灵波具身大模型挑战赛在外滩大会启动,由蚂蚁灵波、魔搭社区和阿里云天池共同发起,以 2026 年 7 月开源的 LingBot-VLA 2.0 预训练模型为技术基座,面向全球开发者开放。大赛报名及线上初赛持续至 10 月 26 日,初赛设必做的 RoboTwin 2.0 仿真任务和可选真机创新任务,入围团队将于 11 月 13 日至 15 日在上海参加线下真机黑客马拉松。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划为 67.5%,加入基于模型的强化学习为 72.5%,两者结合达 75%;加入触觉后抽取纸杯与撕纸任务平均成功率从 60% 提升至 72.5%。
推荐理由:生数科技 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解其闭环自进化机制与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
IEEE Spectrum 报道,学术实验室与创业公司正竞相构建触觉数据集与使用技术,以突破精细操作瓶颈。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。