跳到正文
原文
arXiv cs.RO· Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu, Hanlong Li, Tatsuya Matsushima, Yoichi Sato, Kei Ota·· 2 小时前精选AI 评分62

YUBI-STAG:通过自动视频语言对齐为 VLA 提供接触与语义丰富标注

YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding

AI 导读

YUBI-STAG 是一个时空标注与对齐框架,结合接触物体分割与视觉语言模型,自动为操作示范补充物体身份、属性与状态、各夹爪动作、双臂协调及空间接地交互等语义。

推荐理由

论文提出自动为操作示范补充接触与语义标注的框架,并蒸馏出可直接从腕部视频推理的模型,可供数据标注与 VLA 后训练参考。

来源:arXiv cs.RO · arxiv.org