arXiv cs.RO· Yixuan Jiang, Wentong Li, An Liu, Zihao Xin, Fulin Tang, Cong Leng, Yang Gao, Jian Cheng·· 3 小时前精选AI 评分62
GeoScaffold:通过重建学习紧凑几何隐变量,实现高效视觉语言导航
GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation
AI 导读
GeoScaffold 是一个几何监督框架,通过在训练时把深度、连通性和可通行性等几何信息内化进策略,避免推理阶段引入深度传感器、3D 编码器或逐步感知调用。方法先在训练轨迹的深度图上学习一个紧凑深度 tokenizer 并冻结,再用少量可学习几何查询 token 微调策略,使其隐藏状态重建导航关键几何,从而将查询状态变为用于动作解码的紧凑几何隐变量。
推荐理由
提出训练期几何监督、推理期不增开销的 VLN 方案,为边缘部署的空间感知导航提供可迁移思路。
来源:arXiv cs.RO · arxiv.org