跳到正文
原文
HF blog·· 2 天前精选AI 评分80

EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

HaoWang00/EWAM · Hugging Face

AI 导读

EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

推荐理由

EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

来源:HF blog · huggingface.co