HF blog·· 2026-07-08AI 评分40
Rank-Then-Act:用帧序进度实现无奖励强化学习控制
Paper page - Rank-Then-Act: Reward-Free Control from Frame-Order Progress
AI 导读
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
来源:HF blog · huggingface.co