跳到正文

#模型发布

今日 3 条
今天10月1日周四
9月30日周三
  1. HF blog72

    ECHO-G 发布:从语音和文本生成宇树 G1 全身动作

    ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。

    推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。

  2. HF blog80

    EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

    EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

    推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

9月29日周二
  1. HF blog22

    castanetnicolas 的 ACT UR5e 方形螺母装配策略上线 Hugging Face

    Hugging Face 上发布了一个基于 ACT(Action Chunking with Transformers)的 UR5e 模仿学习策略,用 LeRobot 0.6.1 训练,任务是把方形螺母装到方形销上。该策略使用 100 条遥操作数据(24602 帧、20 FPS)训练 10 万步,输入两路 84×84 图像和 9 维状态,输出 7 维动作,目前尚未提供评测结果。