跳到正文

#强化学习

今日 0 条
9月30日周三
9月29日周二
  1. HF blog60

    strands-robots 用 Isaac Lab 训练宇树 Go2 并录制 LeRobot 数据集

    strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。

    推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。

  2. HF blog62

    strands 发布 Isaac Lab Shadow Hand 手中方块重定向 PPO 策略

    cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。

    推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。

9月28日周一
9月17日周四
  1. IsaacLab releases78

    Isaac Lab 3.0 早期访问版发布,支持多后端与无 Kit 运行

    Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。

    推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。

9月11日周五
  1. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。

9月10日周四
  1. HF blog62

    用 HF Jobs 与 Storage Bucket 实现跨机 Async GRPO LoRA 训练

    Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。

    推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。

8月28日周五
  1. HF blog24

    Agentic Game Development 作为可验证轨迹数据引擎:为世界模型扩展提供数据

    论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。

8月19日周三
  1. HF blog78

    NeDM Study 4 数据集发布:宇树 Go2 在 CRM 颗粒地形上的神经降维动力学复现材料

    Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。

    推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。

8月6日周四
  1. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
7月28日周二
  1. HF blog44

    多轮长时程规划的物理学:从预训练到后训练的单教师与多教师在线策略智能体蒸馏

    研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。

  2. HF blog43

    机器人学习中的进度奖励建模:一篇综合性综述

    一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。

7月20日周一
7月11日周六
  1. genesis releases38

    Genesis v1.2.2 发布:新增高吞吐触觉传感器系列,非凸碰撞检测更稳健

    Genesis 发布 v1.2.2,新增面向强化学习灵巧策略训练的高吞吐真实触觉传感器系列,并支持迟滞、失效触觉单元、探针增益等噪声选项。非凸碰撞检测鲁棒性提升,性能与凸分解相当,修复了虚假深层接触与薄壳穿透问题;启用 noslip 后处理对所有后端的减速降至 20% 以内。

7月8日周三
11月1日周六
9月29日周一