跳到正文
原文
arXiv cs.RO· Pingrui Zhang, Yu Zhang, Pengyuan Wu, Bin Wang, Haoming Song, Xianqiang Gao, ZhaxiZhuoma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li·· 3 小时前精选AI 评分60

MixVLA:面向可泛化视觉语言动作模型的自适应非不变信息混合

MixVLA: Adaptive Mixing of Non-Invariant Information for Generalizable Vision-Language-Action Models

AI 导读

作者提出 MixVLA,一个无需额外 OOD 数据或改动架构的模型无关训练框架,用于提升视觉语言动作模型的零样本泛化能力。其核心组件 AMI 随机混合非不变表征以正则化分布特异性变化,再与不变表征融合进行动作预测。在 LIBERO、LIBERO-Plus、RoboTwin 扰动套件及真实世界任务上的实验显示,MixVLA 提升了整体零样本鲁棒性,同时保持较强的域内性能。

推荐理由

提出模型无关的 VLA 训练框架 MixVLA,在 LIBERO 等基准与真机任务上验证零样本鲁棒性提升。

来源:arXiv cs.RO · arxiv.org