跳到正文
原文
HF blog·· 2026-07-08AI 评分40

Rank-Then-Act:用帧序进度实现无奖励强化学习控制

Paper page - Rank-Then-Act: Reward-Free Control from Frame-Order Progress

AI 导读

Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。

来源:HF blog · huggingface.co