HF blog·· 2 天前精选AI 评分80
EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作
HaoWang00/EWAM · Hugging Face
AI 导读
EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。
推荐理由
EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。
来源:HF blog · huggingface.co