跳到正文

#开源/仓库

今日 5 条
今天10月1日周四
9月30日周三
  1. HF blog72

    ECHO-G 发布:从语音和文本生成宇树 G1 全身动作

    ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。

    推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。

  2. HF blog80

    EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

    EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

    推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

9月29日周二