生数发布世界模型 Motus2,探索机器人闭环自进化
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
SteadyTray 提出分层强化学习架构 ReST-RL,将运动与负载稳定解耦,在宇树 G1 人形硬件上实现零样本仿真到真实迁移,可应对多种物体与外力扰动。Agility Robotics 的视频展示了人形机器人拖动沙发的场景。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Hugging Face 发布开源鸭子机器人 Microduck,售价 399 美元,圣诞节前发货。这款高 25 厘米的机器人能摇摆行走、用喙叼取物品、跌倒后自行站起、蹲下甚至滑旱冰,通过摄像头、激光雷达和两个 IMU 感知环境。Pollen Robotics 表示其行为可在仿真中训练并直接部署到机器人上,SDK、仿真和完整强化学习训练栈已在 GitHub 开放。
无界动力在2026世界机器人大会上集中展示以隐空间世界模型为核心的具身通用大脑MWA™,并提出“隐空间世界模型+强化学习”技术路线。创始人张玉峰称世界模型价值在于推演行动如何改变世界,公司主张“用工业练技能、用商业练泛化”。CTO夏中谱认为具身智能仍处“诸子百家”早期阶段,产品解决方案总经理沈明达则提出工业产线自动化从G1到G5的五级进化。
8月21日世界机器人大会期间,星海图举办“从模型到生产力”技术与产业应用论坛,首席科学家赵行介绍G0.5基础模型内嵌原生动作思维链,并预告G0.5 MAX即将发布,同时启动G0.5复现计划,开放模型权重、推理接口、评测基准与微调工具。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
ROS 社区下一次 8 月会议将讨论如何用 Gazebo 运行强化学习算法。Gym Gazebo Sim 是一个教育软件工具包,用于帮助初学者上手。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
团队发布 gym-gazebo-sim,将 erlerobotics 在 ROS1 与 Gazebo Classic 上的 gym-gazebo 框架移植到 ROS2 Jazzy 与 Gazebo Sim Harmonic,用于训练强化学习智能体。该工具设计为可在低性能电脑上运行,将用于其机器人学本科入门课程,并会随使用持续演进。
RSS 2026 公布论文奖项,共收到 708 篇投稿、录用 210 篇,接收率 29.7%,8 篇进入 Final List 后评出三项最佳论文。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
无问芯穹联合清华大学等研发的具身智能强化学习基础设施 RLinf 升级至 v0.3,首次完整打通数据采集、数据管理、SFT、RL、模型评测与真机部署环节,形成从仿真训练到真机在线学习的统一开发闭环。
原力灵机发布首款具身世界模型 DW0.5,并接入世界模型驱动的具身智能后训练框架 DFOL2.0。DW0.5 由 Video Expert、Action Expert、Value Expert 三大专家模块组成,用上万小时真机多视角数据联合预训练,可预测动作执行后的未来状态并生成失败轨迹,据其披露可让后训练中真机数据需求骤降 60%、整体训练成本下降 40%。
推荐理由:原力灵机披露 DW0.5 世界模型接入后训练框架的完整闭环,读者可了解其三大专家模块设计与真机数据需求下降 60% 的实测数据。
Genesis 发布 v1.2.2,新增面向强化学习灵巧策略训练的高吞吐真实触觉传感器系列,并支持迟滞、失效触觉单元、探针增益等噪声选项。非凸碰撞检测鲁棒性提升,性能与凸分解相当,修复了虚假深层接触与薄壳穿透问题;启用 noslip 后处理对所有后端的减速降至 20% 以内。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。
Sony AI 开发的自主乒乓球机器人 Ace 在测试中五场赢下三场,对手是训练十年以上、每周约 20 小时的精英选手,但对阵日本职业联赛选手两场均告负,仅赢下一局,相关系统细节发表在 Nature 论文中。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。
NVIDIA 发布教程,介绍如何用 Isaac Lab 和 Newton 训练四足机器人运动策略,并仿真布料操作。内容围绕机器人仿真中的物理基础展开,面向研究人员和工程师,用于在安全、加速且低成本的环境中训练、开发、测试和验证机器人控制算法与原型设计。