Hugging Face 发布 strands-isaaclab-h1-rough 数据集:宇树 H1 人形机器人崎岖地形行走
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
Hugging Face 上发布 strands-isaaclab-ant-131k-policy,这是用 rsl_rl PPO 在 Isaac Lab 的 Isaac-Ant 任务上训练的机器人策略,训练规模达 131,072 个并行环境。
strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。
推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。
cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。
推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-mining-no-cf-divl,这是一个基于父代冻结扩散 actor 与分布式 DIVL critic 的状态型智能体,训练步数 150001,含 5 个随机种子检查点。
Hugging Face 在 Mulligan 项目下发布基于状态的 IDQL 智能体检查点 sim-square-narrow-r03,采用扩散 actor 加标量 IQL critic,训练步数 150001,覆盖 5 个随机种子。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-divl 检查点,基于父代冻结扩散 actor 与分布式 DIVL critic,在 sim-square-narrow 任务训练至 150001 步,含 5 个随机种子。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-mining-no-cf-idql,这是一个基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,包含 policy.pt 和 stats.json 归一化器。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-baseline-repair-r3roll-idql,是基于状态的 IDQL 智能体,含扩散 actor 与标量 IQL critic,提供 policy.pt 和 stats.json。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-baseline-repair-r3roll-divl 检查点,基于父代冻结扩散 actor 与分布式 DIVL critic,训练至 150001 步,含 5 个随机种子。
Mulligan 在 Hugging Face 发布基于状态的 IDQL 智能体 sim-square-narrow-r03-auto-plain-il-n1-idql,用于 sim-square-narrow 任务,包含 5 个随机种子、训练步数 150001 的 PyTorch 检查点。
Hugging Face 上的 Mulligan 组织发布 sim-square-narrow-r03-auto-iql-success-bc-n32-idql,这是一个基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,任务为 sim-square-narrow,训练步数 150001,含 5 个随机种子检查点。
Hugging Face 上的 Mulligan 组织发布 sim-square-narrow-r03-auto-iql-success-bc-n32-divl 检查点,这是一个基于状态的智能体,使用父级冻结扩散 actor 与分布式 DIVL critic,任务为 sim-square-narrow,训练步数 150001,含 5 个种子。
Hugging Face 上 Mulligan 组织发布 sim-square-narrow-r03-auto-iql-n32-idql,这是一个基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,任务为 sim-square-narrow,属 R3 轮次。
Hugging Face 上线 mulligan/sim-square-narrow-r03-auto-iql-n32-divl 模型仓库。该条目名称显示其与 sim-square-narrow 任务、auto-iql 方法及 n32 配置相关,具体性能与训练细节尚未在页面中披露。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-mining-no-cf-idql,这是一个基于状态的 IDQL 智能体,由扩散 actor 与标量 IQL critic 组成,提供 policy.pt 和 stats.json。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-mining-no-cf-divl,这是一个基于状态、使用父级冻结扩散 actor 与分布式 DIVL critic 的智能体,任务为 sim-square-narrow,训练步数 150001,含 1-5 共 5 个种子检查点。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02 的 IDQL 智能体检查点,采用扩散 actor 加标量 IQL critic,训练步数 150001,覆盖 5 个随机种子。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-baseline-idql,为基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,含 policy.pt 和 stats.json。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-baseline-divl 基线智能体,用于 sim-square-narrow 任务,采用父级冻结扩散 actor 与分布式 DIVL critic,训练步数 150001,含 5 个随机种子检查点。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-baseline-divl,这是一个基于状态的智能体,使用父级冻结扩散 actor 与分布式 DIVL critic,任务为 sim-square-narrow,训练步数 150001。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r02-baseline-idql 基线检查点,为基于状态的 IDQL 智能体,采用扩散 actor 与标量 IQL critic,含 policy.pt 和 stats.json。
Hugging Face 的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-repair-no-r3roll-divl 检查点,基于父代冻结扩散 actor 与分布式 DIVL 评论家,训练步数 150001,含 1-5 共 5 个种子。
Hugging Face 上的 Mulligan 项目发布 sim-square-narrow-r03-mulligan-repair-no-r3roll-idql 检查点,为基于状态的 IDQL 智能体,采用扩散 actor 加标量 IQL critic,含 policy.pt 与 stats.json 归一化文件。
Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。
推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
Genesis 发布 v1.2.2,新增面向强化学习灵巧策略训练的高吞吐真实触觉传感器系列,并支持迟滞、失效触觉单元、探针增益等噪声选项。非凸碰撞检测鲁棒性提升,性能与凸分解相当,修复了虚假深层接触与薄壳穿透问题;启用 noslip 后处理对所有后端的减速降至 20% 以内。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
NVIDIA 发布教程,介绍如何用 Isaac Lab 和 Newton 训练四足机器人运动策略,并仿真布料操作。内容围绕机器人仿真中的物理基础展开,面向研究人员和工程师,用于在安全、加速且低成本的环境中训练、开发、测试和验证机器人控制算法与原型设计。