跳到正文
热点事件持续更新

ESP单步多模态动作生成策略

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.RO 报道研究者提出 ESP(Energy-Score Policy)策略。该方法无需教师模型,将策略上下文与噪声在单次网络评估中直接映射为动作块,并用能量分数而非均方误差训练动作头,以学习多模态动作分布,从而避免扩散与流匹配策略的迭代采样。在仿真与真实世界操作任务上,ESP 的任务成功率与流匹配基线相当,动作生成延迟显著更低。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.RO精选
    ESP:单步生成多模态动作的能量分数策略

    研究者提出 ESP(Energy-Score Policy),一种无需教师模型的方法,将策略上下文与噪声在单次网络评估中直接映射为动作块。ESP 用能量分数而非均方误差训练动作头,以学习多模态动作分布,避免扩散与流匹配策略的迭代采样。在仿真与真实世界操作任务上,其任务成功率与流匹配基线相当,动作生成延迟显著更低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。