跳到正文

全部动态

今日 7 条
今天10月1日周四
  1. genesis releases22

    Genesis v1.4.3 发布:提升 GPU 仿真速度并降低显存占用

    Genesis 发布 v1.4.3,重点提升 GPU 上非批处理至中等批量(约 4000)的仿真速度并全面降低显存占用,Windows 上编译速度最高提升至 3 倍。该版本还修复了 glTF 解析、MJCF 材质纹理保留、Apple Metal 性能模式编译失败、IMU 读数记录与相机外参更新等多项问题,并升级至 Quadrants 1.3.3。

9月30日周三
  1. HF blog28

    ReImaGin:用图像生成模型为多模态 LLM 做视觉推理

    Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。

  2. HF blog72

    ECHO-G 发布:从语音和文本生成宇树 G1 全身动作

    ECHO-G 发布,可从语音和文本生成宇树 G1 的全身动作,所有模型输出 39 通道机器人运动,帧率 30 FPS。代码版本 v0.2.0,提供音频加文本、纯音频、纯文本及 HumanRetarget 多组权重,新输入支持最长 20 秒或 600 帧、256 个文本 token,更长输入需先分段。

    推荐理由:ECHO-G 开源了从语音和文本生成宇树 G1 全身动作的模型权重与推理流程,读者可据此了解输入规格与复现入口。

  3. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  4. HF blog38

    Hugging Face 发布 Sys1Cal-v1 数据集:评估 Jev 等结构化概率输出的校准问题

    Hugging Face 发布 Sys1Cal-v1 基准数据集,用于直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现,Noul 和 Score 的概率接近真实值,而二元 Choice 输出存在系统性非线性失真,可通过引入潜在第三分量 Uncertain 建模。数据集与评估代码已公开,支持在其他结构化决策模型上复现。

  5. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。