跳到正文

全部动态

今日 9 条
9月15日周二
9月13日周日
  1. genesis releases30

    Genesis v1.4.1 发布:大幅提升大规模场景 CPU/GPU 性能

    Genesis 发布 v1.4.1,重点提升大规模场景下 CPU 与 GPU 的性能,速度随岛屿数量呈亚线性下降,不平衡场景的 Jacobi 均衡开销大幅降低,接触密集场景在 CPU 上明显加速。新版本支持不含 joint2 的 MJCF 关节等式,并修复 glTF 归一化整数访问器解码、法线与纹理坐标保留、MJCF 关节执行器力范围等问题。

9月12日周六
  1. HF blog41

    World in World:用世界模型探索世界,免训练实现相机与时间控制

    World in World 是一种免训练的推理时接口,让冻结的自回归视频世界模型支持灵活的相机与时间控制。它把源视频观测、目标视角场景投影、几何渲染和缓存外已生成状态等异构证据转为带相机与时间标签的干净视觉状态,通过原生自注意力读取,并用对应路由器和 EWA 逐通道调节注意力。同一冻结骨干可支持相机控制重渲染、长时程回访和人体动作迁移。

9月11日周五
  1. HF blog33

    SpatialBlock:用合成积木堆叠任务提升 LVLM 空间智能

    研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。

  2. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。

  3. NVIDIA blog robotics71

    Skild AI 发布 S1 机器人基础模型,单段视频即可学习新任务

    Skild AI 发布 S1 机器人基础模型,可用单段视频演示作为提示,在不更新权重、不做任务专项后训练的情况下执行此前未见的长程任务,最长约 10 分钟,涵盖装盆、做煎饼、手冲咖啡和套件装配等。

    推荐理由:S1 用单段视频提示完成长程任务且不更新权重,读者可据此判断免重训部署路径的可行边界。

9月10日周四
  1. HF blog62

    用 HF Jobs 与 Storage Bucket 实现跨机 Async GRPO LoRA 训练

    Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。

    推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。

  2. HF blog60

    SyncWorld:视觉校准让世界模型成为零样本模拟器

    Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。

    推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。

9月9日周三
  1. mujoco releases38

    MuJoCo 3.13.0 发布:新增 discrete 积分器与 Python 3.15 支持

    MuJoCo 3.13.0 发布,新增 discrete 积分器,将约束求解与隐式速度更新合并为一步,使被动弹簧和执行器位置增益在远超显式稳定极限的时间步下保持稳定。该版本还新增 Python 3.15(GIL 与自由线程)支持、站点几何关联网格、传感器 cutoff 属性,并移除 implicit/implicitfast 下 flex 有效度量的特例,相关模型需改用 discrete 积分器。

9月8日周二
9月7日周一
  1. genesis releases36

    Genesis v1.4.0 发布:支持场景与轨迹导出为独立归档并位精确回放

    Genesis 发布 v1.4.0,支持将场景连同完整轨迹导出为独立归档,可在任意机器上通过 gs replay 实现位精确回放,目前仅支持刚体求解器。该版本还新增在内存中保存与恢复已构建场景、在连杆任意局部点施加外部力旋量,并修复了大量与资产解析相关的缺陷。

9月3日周四
9月2日周三
  1. HF blog62

    Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

    Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。

    推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。

  2. HF blog74

    ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型

    ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。

    推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。

  3. HF blog62

    H3-World:把语言理解变成世界控制,将 33B MiniMax-H3 视频生成器改造为交互式世界模型

    H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。

    推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。

  4. HF blog60

    DroneCATS 评测多模态 LLM 作为无人机视觉语言动作智能体

    论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。

    推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。

9月1日周二
  1. HF blog71

    LightNav-0:用 VLM 空间智能实现通用具身导航

    LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。

    推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。

  2. HF blog45

    MineAmongUs:VLM 智能体在具身社交互动中的言语与非言语欺骗

    Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。

8月31日周一
  1. HF blog71

    VLAct:面向视觉语言动作模型的表征中心持续预训练

    论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。

    推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。

  2. HF blog71

    PonderPounce:用预训练 MLLM 作为机器人控制的回合上下文引擎

    PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。

    推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。

  3. HF blog62

    Code-as-World:用可执行代码表示物理世界,为视觉语言模型提供物理推理监督

    论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。

    推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。

8月30日周日
8月29日周六
8月28日周五
  1. HF blog38

    论文:评估许可证意味着什么?Inspect Evals 中声明可复现性的提交绑定普查

    一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。

  2. HF blog62

    TacForcing:用执行时触觉反馈的流式动作生成框架

    TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。

    推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。

  3. HF blog24

    Agentic Game Development 作为可验证轨迹数据引擎:为世界模型扩展提供数据

    论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。