Cue the Flow:用空间线索引导流匹配策略完成开放世界配送操作
论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。
推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。
追踪感知与导航的研究、可复用工程方法与真实部署证据。
论文提出 Cue the Flow,用预训练流匹配视觉语言动作模型作为底层控制接口,把高层 grounding 输出当作空间线索来引导策略,并引入轻量线索条件适配器:先以对比目标学习显著且具空间区分度的线索表示,再监督预测动作块上的对角仿射变换。
推荐理由:论文把预训练流匹配 VLA 当作底层控制接口,用轻量适配器把空间线索转成动作块上的仿射变换,为开放世界配送操作提供了一条可迁移的引导思路。
作者提出 LME(Local-Minimum Escaper),一个程序化分层框架,通过显式生成并推理子目标,引导移动机器人脱离局部极小值区域。LME 仅依赖局部观测,用可解释的启发式准则结合障碍几何与候选位置安全性来选取子目标,再由局部规划器生成底层运动指令,无需额外训练且不依赖具体局部规划器。
推荐理由:论文提出用可解释启发式生成子目标来摆脱局部极小值,且不依赖底层规划器、无需额外训练。
DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。
推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。
Yggdrasil 是一个面向机器人感知的层优先分层3D场景图,用通用节点、边和层表达现有管线已产出的室内外、扁平或分层表示,并原生回答下游任务的位置与语义查询。
推荐理由:论文提出面向实时查询优化的分层3D场景图,并给出查询延迟与三条感知管线的集成数据。
Galbot 团队在六个领域系统评测 GPT-6 Astra 作为通用具身策略的表现,涵盖直接控制、与学习策略协作和反馈驱动适应。
推荐理由:系统评测 GPT-6 Astra 作为具身策略在六类任务上的表现,并给出成功率与推理延迟数据,可据此判断通用模型与物理控制的差距。
SAKI 是一个连接人类视频技能获取、跨示范组装与闭环全身执行的框架,用于长时程移动操作。它准备以物体为中心的可复用技能,在给定目标和任务依赖时选择并排序技能、把物体角色绑定到当前场景,并在技能间传递场景估计与机器人构型;全身运动学模仿生成协调的底盘、手臂与夹爪运动。
推荐理由:论文提出从人类视频组装可复用技能并做全身运动学模仿,读者可了解长时程移动操作的一种组合式思路。
一篇题为《In-Context Learning for Robots: Methods and Applications》的综述将机器人上下文学习文献按上下文证据到执行的接口分为四类:上下文条件策略、几何示范迁移、基于世界模型的控制,以及基于技能与智能体的执行。
推荐理由:这篇综述把机器人上下文学习拆成四类接口,并梳理了迁移假设与评测方式的差异,适合用来建立该方向的方法地图。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。
推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。
UrbanGround 是一个基于香港全域三维地理数据构建的真实尺度城市副本沙盒,用于测试多模态大语言模型智能体能否在闭环第一人称视角下完成可靠导航与空间推理。
推荐理由:UrbanGround 用香港全域三维数据搭建可闭环交互的城市沙盒,读者可了解 MLLM 智能体在长程城市导航中的能力边界。
LingBot-VLA 2.0 在 LingBot-VLA 基础上从三方面改进:重构数据处理流程并预训练约 6 万小时数据,含 5 万小时覆盖 20 种机器人构型的轨迹和 1 万小时第一人称人类视频;动作空间扩展到头部、腰部、移动底盘和灵巧手的自由度;引入视频表示模型与深度估计模型做未来预测的代理任务以增强时序推理。
推荐理由:论文给出 LingBot-VLA 2.0 在数据规模、动作空间与预测建模三方面的改动,可了解 VLA 落地差距的一种应对思路。
Image2Sim 是一个实时神经仿真框架,可从带位姿的 RGB-D 图像序列构建可交互的具身导航环境。相关代码与具体使用说明已在 GitHub 页面发布。作者感谢 Gim Hee Lee 教授的指导,以及阿里巴巴、香港科技大学的 Yinghao Xu 教授提供的 64 张 H20 GPU 支持。
推荐理由:Image2Sim 用带位姿的 RGB-D 序列生成可交互导航环境,读者可了解神经仿真如何降低具身导航的数据门槛。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。