arXiv cs.RO· Rhythm Syed, Jean Mercat, Sedrick Keh, Kushal Arora, Paarth Shah, Aykut Onol, Mengchao Zhang, Tony Dear·· 20 小时前精选AI 评分62
SUAVE:用掩码扩散统一视频与动作建模
SUAVE: Unified Video-Action Models via Masked Diffusion
AI 导读
SUAVE 是一个单词汇表统一动作-视频模型,用掩码扩散 Transformer 在共享序列中以离散 token 生成视频和动作,推理时选择掩码位置即可让同一网络充当世界模型、机器人策略或视频-动作模型。
推荐理由
论文提出用掩码扩散统一视频与动作建模,读者可了解同一网络如何切换世界模型与策略两种角色。
来源:arXiv cs.RO · arxiv.org