跳到正文

#论文/研究

今日 0 条
9月30日周三
  1. HF blog28

    ReImaGin:用图像生成模型为多模态 LLM 做视觉推理

    Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。

  2. HF blog62

    AnyStep-WAM:面向世界动作模型的预算对齐蒸馏与自适应推理

    论文提出 AnyStep-WAM 框架,通过预算对齐的教师轨迹蒸馏训练区间条件流映射,支持从单步预测到多步细化的动作生成,并用轻量风险收益调度器按单步预览选择最小去噪预算。

    推荐理由:论文给出可调去噪步数的世界动作模型框架,读者可了解按任务难度分配推理预算的具体做法与实测数据。

  3. HF blog38

    Hugging Face 发布 Sys1Cal-v1 数据集:评估 Jev 等结构化概率输出的校准问题

    Hugging Face 发布 Sys1Cal-v1 基准数据集,用于直接评估结构化概率输出而非仅检查预测类别的置信度。在 Jev 上测试发现,Noul 和 Score 的概率接近真实值,而二元 Choice 输出存在系统性非线性失真,可通过引入潜在第三分量 Uncertain 建模。数据集与评估代码已公开,支持在其他结构化决策模型上复现。

  4. HF blog65

    EVO-WAM:通过视频动作验证演化世界动作模型

    EVO-WAM 提出一种让世界动作模型(WAM)在无需额外专家示范、也不在外部环境执行候选动作的情况下适配新任务的框架,通过状态预测与锚定多帧上下文实现完整自回归 rollout,并用视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频与动作一致性,再迭代训练。

    推荐理由:论文给出无需额外专家示范、靠自生成视频动作轨迹适配新任务的框架,并附仿真与真机成功率数据。

  5. HF blog66

    CrossBFM:跨人形本体蒸馏共享潜行为空间

    CrossBFM 提出无机器人专属参数的统一编码器架构,借助重定向提供的帧级跨本体对应关系,将行为基础模型的潜空间蒸馏到多个训练本体上,耗时不到一 GPU 小时。

    推荐理由:CrossBFM 把行为潜空间当作可迁移资产,用不到一 GPU 小时蒸馏出跨本体共享空间,读者可据此了解人形策略迁移的训练成本变化。

  6. HF blog38

    LeRF:学习参考坐标系以进行视角采择推理

    Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。

9月29日周二
  1. HF blog58

    ArticuRiddle 数据集发布:100 个外观与关节运动相矛盾的铰接物体

    ArticuRiddle 是一个包含 100 个铰接物体的数据集,用于测试视觉外观与真实关节运动相矛盾时的操作能力。每个物体由 PartManip 训练资产经两类编辑生成:50 个移动或旋转把手使其暗示错误运动,50 个直接交换关节类型(如抽屉面板改为摆动、门改为滑动),外观保持不变。

9月28日周一
9月21日周一
  1. HF blog62

    Learning Foresight without Explicit Trajectories for 3D Diffusion Policies 论文发布

    论文提出 Movement Trend Guidance,让 3D 扩散策略从短观测历史中学习交互演化的紧凑隐表示,训练时用稀疏未来夹爪状态监督,推理时仅保留该隐表示作为未来导向条件。

    推荐理由:论文提出 Movement Trend Guidance,用隐变量为 3D 扩散策略提供交互走向的前瞻信息,并给出多基准对比数据。

9月18日周五
  1. HF blog44

    MiniMax-H3 能否推理物理世界?全模态生成模型评测

    针对 MiniMax-H3 这类全模态生成模型,一项新评测考察其物理世界推理能力,在 517 个评测实例中整体成功率为 41.97%。其中基于视频的决策推理成功率最高,为 56.00%,基于音频的消歧推理最弱,仅 27.40%。评测设计了隐式提示配多帧、音频-图像、前缀视频和音视频四类任务,要求模型跨模态整合互补信息以推断潜在事件状态与未来动态。

  2. HF blog45

    FAMOS:从稀疏观测进行前馈 3D 关节建模

    Hugging Face 论文页发布 FAMOS,一个从稀疏无序部分点云预测可动部件分割与关节参数的前馈模型,支持包括单视图在内的可变数量输入。它提出 Multi-state Articulation Transformer,以交替的状态级与全局注意力聚合多观测关节线索,并引入观测关节跨度目标监督各部件在输入观测中的运动范围。

9月12日周六
  1. HF blog41

    World in World:用世界模型探索世界,免训练实现相机与时间控制

    World in World 是一种免训练的推理时接口,让冻结的自回归视频世界模型支持灵活的相机与时间控制。它把源视频观测、目标视角场景投影、几何渲染和缓存外已生成状态等异构证据转为带相机与时间标签的干净视觉状态,通过原生自注意力读取,并用对应路由器和 EWA 逐通道调节注意力。同一冻结骨干可支持相机控制重渲染、长时程回访和人体动作迁移。

9月11日周五
  1. HF blog33

    SpatialBlock:用合成积木堆叠任务提升 LVLM 空间智能

    研究者提出 SpatialBlock,通过合成积木堆叠任务提升大型视觉语言模型(LVLM)的 3D 空间推理能力。其构建的 SpatialBlock-15k 数据集包含 15,000 个积木堆叠问题,覆盖 3D 到 2D 投影、视角变换和结构组合,并加入受控颜色调制作为视觉线索。实验显示,用该数据集训练的 LVLM 在直接回答和基于推理的预测两种方式下均显著优于基线,并能泛化到真实世界空间任务。

  2. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。

9月10日周四
  1. HF blog60

    SyncWorld:视觉校准让世界模型成为零样本模拟器

    Hugging Face 论文页介绍 SyncWorld,一种通过视觉校准让世界模型在未见相机、环境和本体上做上下文机器人世界建模的方法,无需下游训练。该方法以少量视觉交互作为上下文,尝试模拟机器人控制带来的视觉后果。

    推荐理由:SyncWorld 提出用视觉校准让世界模型在未见相机与环境上做零样本仿真,读者可了解其免下游训练的思路。

9月3日周四
9月2日周三
  1. HF blog62

    Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

    Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。

    推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。

  2. HF blog74

    ZimaBlue:通过可扩展视频预训练演进可泛化世界动作模型

    ZimaBlue 提出从大规模自我中心视频学习可泛化世界动作模型(WAM)的三阶段训练方案,先在大规模人类与机器人自我中心视频上做因果具身视频预训练,再通过视频-动作中期训练将视觉动态对齐到异构机器人轨迹,最后针对目标机器人做专门化。

    推荐理由:论文给出从大规模自我中心视频学习世界动作模型的三阶段方案,并报告零样本操作成功率随数据规模的变化。

  3. HF blog62

    H3-World:把语言理解变成世界控制,将 33B MiniMax-H3 视频生成器改造为交互式世界模型

    H3-World 提出一个框架,把 33B 的 MiniMax-H3 视频生成器改造成交互式世界模型,将语言指令转为精确、时间对齐的角色与相机控制,且不引入专门的动作模块。

    推荐理由:论文给出把 33B 视频生成器改造成交互式世界模型的具体路径,含样本量与可训练参数比例等关键条件。

  4. HF blog60

    DroneCATS 评测多模态 LLM 作为无人机视觉语言动作智能体

    论文提出 DroneCATS-Agent 与 DroneCATS 基准,把多模态大模型直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用模式。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标和多无人机编队指挥四项能力,模型规模下探到 2B。

    推荐理由:DroneCATS 把多模态模型直接放进无人机控制回路,用四类任务对比前沿与 2B 小模型,可看到空间感知与动作协议之间的落差。

9月1日周二
  1. HF blog71

    LightNav-0:用 VLM 空间智能实现通用具身导航

    LightNav-0 是一个紧凑的通用具身导航模型,通过统一指向 token 与动作 token 化调用预训练 VLM 的空间推理能力,在 10 个公开导航仿真设置上取得单目成功率最优。

    推荐理由:论文给出统一 token 接口把 VLM 空间能力接到导航动作上,可了解通用导航模型如何跨任务与本体复用。

  2. HF blog45

    MineAmongUs:VLM 智能体在具身社交互动中的言语与非言语欺骗

    Hugging Face 论文提出 MineAmongUs——一个 3D 多模态 Among Us 沙盒,内鬼智能体需通过言语与非言语动作联合欺骗船员,并配套可配置的 VLM 智能体框架 ARIA,暴露五个认知组件消融轴。实验显示 VLM 智能体依靠言语与非言语联合欺骗取胜,非言语通道在框架消融和跨 VLM 评估中都是更关键的获胜因素。

8月31日周一
  1. HF blog71

    VLAct:面向视觉语言动作模型的表征中心持续预训练

    论文提出 VLAct,一种面向 VLA 的 VLM 骨干,在任务微调前用多本体机器人数据做持续预训练,通过保留 VLM 先验、多头连续动作协同监督和部分统一的跨本体动作布局来共享动作语义。

    推荐理由:论文给出在固定机器人数据预算下以表征为中心的持续预训练路线,并附开源数据与16卡训练配置。

  2. HF blog71

    PonderPounce:用预训练 MLLM 作为机器人控制的回合上下文引擎

    PonderPounce 将预训练 MLLM Ponder 作为 System 2 上下文引擎、快速动作模型 Pounce 作为 System 1 控制器,两者在解耦时钟上端到端联合训练,无需专门记忆模块或桥接预训练。

    推荐理由:原文给出 PonderPounce 在 RoboMME 上的成功率与训练数据倍数,可据此判断双系统记忆方案的效果量级。

  3. HF blog62

    Code-as-World:用可执行代码表示物理世界,为视觉语言模型提供物理推理监督

    论文提出 Code-as-World,将物理环境的组成、动态演化和视觉外观表示为可执行代码,从而为视觉语言模型提供紧凑、可量化、可控的世界抽象。作者构建了受溯因推理启发的智能体发现循环,让智能体提出、执行、渲染、验证并迭代改进可执行世界假设,并用验证后的可执行世界为定量物理推理训练提供可扩展监督。

    推荐理由:论文提出用可执行代码表示物理世界,为视觉语言模型提供可扩展的物理监督,读者可了解其智能体发现循环与基准表现。

8月29日周六
8月28日周五
  1. HF blog38

    论文:评估许可证意味着什么?Inspect Evals 中声明可复现性的提交绑定普查

    一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。