论文:评估许可证意味着什么?Inspect Evals 中声明可复现性的提交绑定普查
一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。
一项提交绑定普查发现,Inspect Evals 的 124 个评估中有 110 个无法复现到其对应的声明,在确定性推理之前就已中断。论文认为,若评估未绑定到产生该分数的确切代码,排行榜数字与部署决策之间就存在缺口。作者还建议进一步检验评估的推理是否与模型在生产中的实际行为一致。
TacForcing 是一个流式动作生成框架,用流式动作专家和执行感知触觉注意力(EATA)在执行过程中引入实时触觉反馈,以改善接触密集操作。论文指出,基于分块预测的视觉语言动作模型在执行前采集观测、预测完整动作块,导致执行期间触觉条件滞后,而现有触觉反应方法多依赖独立的高频控制器,增加架构与训练复杂度。
推荐理由:论文提出在执行中引入触觉反馈的流式动作生成框架,并给出仿真与真机任务的成功率对比。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Hugging Face 论文页发布 GameWAM,一个面向原生视频游戏控制的统一世界动作模型,通过块因果流匹配、模式特定分布和块循环重规划,联合预测未来画面与可执行键鼠动作。实验显示其任务成功率具竞争力,且执行的原生动作数少于对比智能体;研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。
论文提出概率对齐这一分布层面的世界模型要求,并发布 PAWBench 基准与 PAWEval 协议,把重复生成的视频 rollout 转成物理行为的经验分布。在 50 个场景和 11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。作者随后测试语言提示、初始噪声采样和模型训练能否改变模型的预测分布。
推荐理由:论文把世界模型评估从单条视频合理性推进到行为分布层面,并给出 PAWBench 与 PAWEval 的具体评测协议。
UrbanGround 是一个基于香港全域三维地理数据构建的真实尺度城市副本沙盒,用于测试多模态大语言模型智能体能否在闭环第一人称视角下完成可靠导航与空间推理。
推荐理由:UrbanGround 用香港全域三维数据搭建可闭环交互的城市沙盒,读者可了解 MLLM 智能体在长程城市导航中的能力边界。
Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。
推荐理由:论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。
Hugging Face 论文页收录《What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents》,从 ACE 视角审视 LLM 智能体的数据生成问题。该页面目前仅开放论文讨论,未给出具体方法、数据规模或实验结果。
Google DeepMind 发布白皮书《Visual General Intelligence》,探讨以视觉为中心、从图像、视频和几何等模态的学习中能否涌现出通向 AGI 的智能,并将其称为视觉通用智能(VGI)。白皮书由多位不同机构作者共同撰写,目标不是给出视觉智能的唯一定义,而是厘清 AGI 时代计算机视觉应追求的原则、视觉输入模态、基准、学习范式,以及视觉作为核心与语言等其他模态的关系。
Hugging Face 上线 mepi31415/WorldToken_Experiment_Records 数据集,公开 WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning 的训练日志、配置、评估结果与 rollout 视频。
推荐理由:WorldToken 论文的实验记录与检查点打包公开,读者可据此复现多任务控制与长历史实验的表格结果。
Hugging Face 论文页上线 EXIMO,一种用视觉语言模型(VLM)引导 VLA 策略探索的方法。页面目前仅开放论文讨论,未披露模型版本、任务本体、仿真或真机结果等细节。
Hugging Face 博客介绍 TinyCast,一个 146,505 参数的零样本时间序列基础模型,是 GIFT-Eval 榜单上最小的公开逐配置结果且无测试数据泄漏的模型,也是 140 万参数以下唯一输出预测分布而非点预测的零样本模型。
τ_0-VLA 是一个分层视觉语言动作模型,把高层子任务生成建模为可扩展算力的推理问题,通过世界模型引导的测试时计算在需要时搜索备选子任务再输出。高层策略利用执行记忆生成子任务,低层策略在多种机器人本体上执行,模型基于 40,115 小时异构真实数据与多模态联合训练。在域内和分布偏移设置下,增加测试时计算量可提升下一子任务预测准确率,并转化为长时程操作任务的闭环成功率提升。
推荐理由:论文提出用世界模型引导的测试时搜索为高层子任务决策分配更多算力,并给出跨本体与分布偏移下的闭环结果。
GOAG 是一种物体无关的深度生成式抓取规划器,学习特定夹爪的接触面分布,无需物体特定训练数据即可为未见物体采样有效抓取。作者在仿真与真实场景的抓取协议上验证该方法,在 MultiDex 数据集上取得 86.93% 的平均成功率,生成大量抓取时处理速度明显更快,性能与专门在该数据集上训练的方法相当。代码与视频见项目网站 https://cea-list.github.io/goagweb/。
推荐理由:论文提出与物体无关的抓取规划思路,读者可了解其如何用夹爪接触面分布替代物体特定训练数据。
CoToGrasp 是一个以特定接触拓扑为条件生成多样稳定抓取的生成框架,采用与物体无关、以夹爪为中心的工作空间实现零样本泛化。该方法完全在物体无关的方式下训练,通过特征化规范工作空间将局部物体特征投影到统一的夹爪中心域,解耦语义功能意图与物体几何。
Hugging Face 论文页发布 EnvHarness,提出为智能体学习"唤醒静态世界"的方法。该页面目前仅开放论文讨论,未披露模型版本、任务本体、成功率或真机部署等具体细节。
Hugging Face 论文页发布 ForgeWM,一种面向少步动作条件视频世界模型的渐进式因果训练方法。该页面目前仅开放论文讨论,未披露模型规模、任务本体、成功率或推理时延等具体结果。
Hugging Face 论文页面发布 PolicyGuide,将 LLM 智能体的策略合规从守护单个动作扩展为引导整个工作流。页面仅提供论文标题与讨论入口,未披露模型版本、评测数据或成功率等细节。
Hugging Face 论文页上线 FACET,一种在终端任务合成中保留源意图与可执行状态的方法。该页面目前仅开放论文讨论,正文未披露模型版本、任务成功率或真机验证等具体结果。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
Ego2Robot 提出一条可扩展流程,通过动作重定向、机械臂视觉合成和多级质量筛选,把第一视角人类操作视频转换为机器人训练数据,支持精选数据集与野外视频,产出 18,561 小时数据、覆盖 15 种机器人形态。
推荐理由:论文给出将第一视角人类视频转为机器人训练数据的可扩展流程,并公开数据规模与泛化评测设置。
BridgeVLA++ 在 BridgeVLA 基础上加入统一时空记忆架构,可对观测历史进行推理,同时保留原框架的数据效率与泛化能力。该框架在两个记忆依赖型操作基准上取得 state-of-the-art 表现,并在双臂操作设置和另一个真实机器人平台上完成验证。项目主页为 https://bridgevla-plus.github.io/。
推荐理由:BridgeVLA++ 在原有数据效率基础上加入时空记忆,读者可了解记忆增强 VLA 在 3D 操作任务上的设计思路与验证范围。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
一篇论文在动态 FrozenLake 测试台上研究记忆增强 VLM 智能体的空间记忆过期问题,覆盖三个闭源模型和三个开放权重 VLM,在文本与图像输入下完成 1,800 次过期检测运行,并在共享 50 种子规模下完成 12,000 个文本模式导航回合。
Hugging Face 论文页面发布 PAST-Bench,用于评测个人智能体递归自我改进的基础能力。该基准聚焦个人智能体场景下的自我改进研究,目前页面仅开放论文讨论,未披露具体任务、指标或实验结果。
MiniWorld 是一个从零训练流式视频世界模型的可复现框架,采用块因果视频扩散 Transformer,在预训练 Video VAE 的潜空间中以 Flow Matching 训练,并基于 Diffusion Forcing 使用分块非递减噪声调度和两阶段继续训练。
推荐理由:MiniWorld 给出从零训练流式视频世界模型的完整方案与代码,读者可据此评估单机 8 卡复现的可行性。
Push-Wiper 将黏性污渍清洁重构为聚集问题,用海绵通过分段推扫轨迹逐步聚集污渍,再经后处理分离聚集物并实现海绵自清洁。该方法用 Diffusion Policy 生成自适应推扫动作序列,经任意表面位姿插值器(ASPI)和力位混合控制器执行,清洁得分(去除污渍面积百分比)最高比基线方法高 130%。
Hugging Face 论文页发布 ST-WAM,一个面向视觉分布偏移下鲁棒操作的语义-时序世界动作模型。该模型将语义与时序信息引入世界动作模型,用于提升操作任务在视觉分布变化下的鲁棒性。论文页未给出更多实验数据与真机结果细节。
Hugging Face 上线论文《Quo Vadis, World Modeling?》的讨论页面,邀请社区就该论文参与讨论。原文未披露论文的具体方法、模型或实验数据。
Hugging Face 上线论文页面 ExplainBench,用于评估智能体生成的代码解释。该页面目前仅开放讨论,正文未披露基准的具体任务、指标或实验结果。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
Hugging Face 论文页介绍 OmniPack,一种面向全模态大语言模型的统一 token 压缩方法,目标是提升这类模型的计算效率。页面未给出具体模型版本、压缩率或实验数据,仅提供论文讨论入口。
GROVE 是一个免训练框架,用单一因果增长的记忆统一反应式视频问答与主动辅助,支持多尺度检索。它把细粒度感知证据逐步整合为带时间戳的时刻、连贯片段和跨天重复模式,每层配对应的检索技能。在 MM-lifelong 和 EgoServe 等基准上,GROVE 取得所比较方法中的最佳结果,消融显示各时间层与访问技能互补,跨多天证据时模式层收益最大。代码将发布于 GitHub。
推荐理由:GROVE 用单一因果增长记忆统一视频问答与主动辅助,读者可了解其分层记忆与检索设计。
SG-WAM 提出在策略表征空间内学习几何感知、动作条件化的动力学,用自引导潜在预测和几何监督训练,无需大规模预训练。基于 0.9B 模型,它在 LIBERO 上取得 98.5% 平均成功率、LIBERO-Plus 上 73%,并在分布内和分布外真机评测中优于强基线。方法将潜在未来预测、几何接地与流匹配动作生成端到端联合优化。
推荐理由:论文提出在策略表征空间内做几何感知的世界建模,并给出 LIBERO 与真机评测结果,可供关注世界模型与操作策略训练的读者参考。
Hugging Face 论文页发布 Zero-Mem,提出面向 LLM Agent 的零 Token 记忆操作。该工作聚焦 Agent 记忆读写不再消耗 token,具体方法、实验数据与开源情况原文未披露。
Hugging Face 上线论文页面《Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI》,提出一套可复用的逐模态失效分析框架,用于多模态临床 AI。目前页面仅开放论文讨论,正文未披露具体模型、数据集与实验结果。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 演化内核搜索框架,为 Apple Silicon 的 MLX 构建了后端和结构化 CUDA-to-MLX 翻译层,让搜索以现有 CUDA 内核为知识库生成 Metal/MLX 内核。
推荐理由:IBM Research 把 K-Search 扩展到 MLX,并给出 CUDA 到 MLX 的翻译层设计,读者可据此判断跨平台内核迁移的可行路径。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
Hugging Face 论文页发布 LAMAR,一个开源的语言感知多语言对齐重排序器。页面未提供模型规模、训练数据、评测基准或成功率等具体细节,仅开放论文讨论区供交流。