arXiv cs.RO· Lilika Makabe, Heecheol Kim, Yasuyuki Matsushita·· 1 小时前精选AI 评分62
ESP:单步生成多模态动作的能量分数策略
ESP: Energy-Score Policy for One-Step Multimodal Action Generation
AI 导读
研究者提出 ESP(Energy-Score Policy),一种无需教师模型的方法,将策略上下文与噪声在单次网络评估中直接映射为动作块。ESP 用能量分数而非均方误差训练动作头,以学习多模态动作分布,避免扩散与流匹配策略的迭代采样。在仿真与真实世界操作任务上,其任务成功率与流匹配基线相当,动作生成延迟显著更低。
推荐理由
提出用能量分数替代均方误差训练动作头,单次网络评估生成动作块,为降低闭环控制推理延迟提供了一条可迁移思路。
来源:arXiv cs.RO · arxiv.org