HF blog·· 2026-07-20AI 评分46
Muon 何时能帮上智能体强化学习?ALFWorld 上对比 AdamW 的研究
Paper page - When Does Muon Help Agentic Reinforcement Learning?
AI 导读
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
来源:HF blog · huggingface.co