跳到正文
原文
HF blog·· 2026-08-28精选AI 评分71

Zero-WAM:以人类视频上下文建模世界与动作,实现开放任务泛化

Paper page - Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

AI 导读

Zero-WAM 提出一种因果视频-动作模型,通过上下文人类视频引导执行训练中未见的操作任务。作者用自动流程将任务采样的机器人轨迹转换为语义匹配的人类视频,构建 HumanGen 数据集,包含 8.6K 个任务、74.2K 对人类-机器人上下文学习配对,并提出上下文未来片段预测(IFP)目标以抑制已见任务的捷径。

推荐理由

论文给出以人类视频作为上下文任务说明的跨任务泛化方案,并公开数据集与仿真对比结果。

来源:HF blog · huggingface.co