跳到正文

#数据/训练

今日 1 条
今天10月1日周四
9月30日周三
  1. HF blog72

    ECHO-G 发布:从语音和文本生成宇树 G1 全身动作

    ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。

    推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。

  2. HF blog80

    EWAM 发布统一具身模型:单一扩散 Transformer 联合处理视觉语言、未来视频与动作

    EWAM 是一个统一具身模型,在单个 flow-matching Diffusion Transformer 中联合处理视觉语言、未来视频和动作 token,无需显式阶段设计即出现按深度分工:浅层从视觉语言专家取指令与当前场景语义,中层转向预测的未来帧表示,深层由动作自注意力主导做运动细化。

    推荐理由:EWAM 把视觉语言、未来视频与动作 token 放进同一扩散 Transformer,并公开各阶段权重与下载方式,便于对照其分层分工与基准结果。

9月29日周二
  1. HF blog62

    strands 发布 Isaac Lab Shadow Hand 手中方块重定向 PPO 策略

    cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。

    推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。

  2. HF blog62

    JapaneseTinyAgentLM-Action-3M 发布:3.1M 参数模型在 ESP32-S3 上把日语指令转为机器人动作 JSON

    ayousanz 发布 JapaneseTinyAgentLM-Action-3M,一个 3,148,608 参数的 decoder-only Transformer,把日语短指令转成 look、set_expression、nod 三类动作的 JSON 数组,非指令或无法执行的请求返回空数组。

    推荐理由:3.1M 参数模型在 ESP32-S3 上本地把日语指令转成动作 JSON,附完整评测与误差区间,可看端侧具身控制的可行边界。

9月28日周一