ReImaGin:用图像生成模型为多模态 LLM 做视觉推理
Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。
Hugging Face 论文页介绍 ReImaGin,它把图像生成模型作为多模态 LLM 的灵活视觉推理机制,可接受自然语言指令执行去除遮挡、由多视角生成平面图等开放式视觉操作。在包含多视角空间推理与碰撞预测的六项视觉推理任务上,ReImaGin 持续优于纯文本推理和专用视觉工具基线,提升最高达 25%。
Hugging Face 论文 OmniTaskonomy 研究视觉生成监督何时能提升视觉理解,发现采用正确训练配方时,图生图(I2I)训练可提升下游图生文(I2T)性能,且 I2I 训练数据越多增益越大。
Hugging Face 发布 LeRF,让视觉语言模型在推理前显式确定提问所指的视角,必要时定位参考人或物体并预测其前、左、上方向,再用轻量工具在图像上画出坐标轴供模型作答。该方法通过监督微调学习坐标系预测与选择性工具调用,用强化学习学习基于自生成坐标系的推理,推理时无需外部感知模型或显式三维重建,在多个基准上提升了视角采择表现,包括想象视角问题。
Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。
推荐理由:Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。
一篇论文在动态 FrozenLake 测试台上研究记忆增强 VLM 智能体的空间记忆过期问题,覆盖三个闭源模型和三个开放权重 VLM,在文本与图像输入下完成 1,800 次过期检测运行,并在共享 50 种子规模下完成 12,000 个文本模式导航回合。
PointDiT 是一种基于普通 ViT 的极简像素空间扩散 Transformer,直接处理原始 3D 点图块,并以预训练 DINOv3 的图像 token 为条件,扩散主干完全从零训练,无需点图 tokenizer。它在单图 3D 重建上超越了复杂的潜空间扩散模型,同时比混合架构更简单,几何结构更锐利,在透明物体等高度歧义区域更稳健。
NVIDIA 介绍用 Vision Programming Interface(VPI)把立体视觉任务分配到 Jetson 的 PVA、OFA、VIC 等专用加速器,以减轻 GPU 负载。
推荐理由:原文给出 VPI 在 Jetson Thor 上调度 PVA、OFA、VIC 的完整代码与实测吞吐,可迁移到多路立体视觉部署。
NVIDIA 机器人研发文摘 R²D² 本期聚焦长时程操作中的感知引导任务与运动规划,指出传统 TAMP 系统依赖静态模型、在新环境中常失效。方案将感知与操作结合,使机器人能在执行过程中更新规划并适应动态场景。