arXiv cs.RO· Xizhe Zhang, Jingfeng Zhang, Zirun Zhou, Hong Jia·· 20 小时前精选AI 评分62
FLTA:面向人到机器人视觉适配的帧级时序对齐框架
Frame-Level Temporal Alignment for Human-to-Robot Visual Adaptation
AI 导读
研究者提出帧级时序对齐(FLTA)框架,利用全局进度先验和局部时序顺序先验,在无需帧级对应标注的情况下适配人类视频预训练的视觉编码器用于机器人操作。在 ResNet-50 和 ViT 编码器上,该方法在平均仿真成功率上分别比最佳基线相对提升 46.93% 和 65.96%,并在真实操作任务上取得更高成功率。作者指出,有效的人到机器人适配更多取决于选择更新哪些参数,而非更新参数的数量。
推荐理由
提出用全局进度先验与局部时序先验对齐人机视频帧,为跨本体视觉表征迁移提供可复用方法。
来源:arXiv cs.RO · arxiv.org