qbitai· 量子位的朋友们·· 27 天前AI 评分71
星尘智能发布 SmoothRL:让在线强化学习适配大模型异步推理
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
AI 导读
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
来源:qbitai · qbitai.com