PRICE:面向具身强化学习的物理关系信用分配方法
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。
推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。
论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。
推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。
研究提出一种倒置的堆叠方式,先训练通用的指令条件化运动策略作为底层,再在其上叠加 N 个运动引导的踢球技能作为任务门控层,使可达步态空间由运动课程而非参考片段决定。
推荐理由:论文把运动策略作为底层、踢球技能作为任务门控层,并给出多方向射门与地形、推力恢复的评测结果。
CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。
推荐理由:论文提出人形机器人末端执行器与根部的方向可调柔顺框架,读者可了解分层强化学习如何调制全身跟踪策略。
TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。
研究者设计了一个"无人机足球"任务,探索主动利用多旋翼螺旋桨下洗流进行操作的可行性。他们建立简化下洗流动力学模型,据此训练强化学习策略完成带球动作,并证明该策略可迁移到真实世界部署。
一项研究将2D仿真中共进化出的通信协议直接迁移到3D物理环境,不重新训练网络权重,用两台e-puck型机器人(GRU网络加残差连接)执行带社交信号的觅食任务。迁移前需三处修正,包括依据残差权重可测不对称性校准饥饿项;即便如此迁移仍部分且不对称,三十个测试种子中仅一个智能体到达食物源。在社交通道加入显式方向信息可改变接收方轨迹并改善个别案例,但仍不足以让第二个智能体到达食物源。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。
推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。
strands-robots 通过 isaaclab train_policy provider 在 Isaac Lab 中训练宇树 Go2 四足机器人 PPO 策略,4096 个并行环境、1500 次迭代、147M 环境步,在单张 NVIDIA L40S 上耗时 57 分 39 秒,速度跟踪成功率 0.98。
推荐理由:原文给出从 Isaac Lab 训练 PPO 策略到录制 LeRobot v3 数据集的完整命令与验证流程,可迁移到其他机器人任务。
cagataydev 在 Hugging Face 发布 strands-isaaclab-shadow-reorient-policy,这是用 strands-robots 的 isaaclab train_policy provider(PR #4227)训练的 rsl_rl PPO 策略,任务为 Isaac-Reorient-Cube-Shadow 手中方块重定向。
推荐理由:读者可据此了解用 strands 工具链在 Isaac Lab 中训练并导出 Shadow Hand 转方块策略的完整流程与实测指标。
Skild AI 在 NVIDIA Isaac Sim 虚拟足球场中让机器人自我对弈约 140 年,训练出人形机器人 Messinator,其大脑基于旗舰基础模型 S1,仅以进球为奖励,盘带、护球、抢断和倒地起身等行为由机器人自行习得。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
Isaac Lab 3.0 Early Access 发布,引入工厂式多后端架构,物理、渲染与可视化可分别选择 isaacsim_physx、ovphysx、newton_mjwarp 等配置,并支持不安装 Isaac Sim 的无 Kit 工作流。
推荐理由:Isaac Lab 3.0 早期访问版把物理、渲染与可视化拆成可切换后端,并给出 2.x 到 3.0 的迁移清单,便于评估现有训练流程的改动量。
亮源新创过去一个多月连续发布LightParkour、LightNav-0和Light REACT三项技术,分别面向复杂接触技能扩展、通用导航和全身韧性控制。
生数科技发布世界模型 Motus2,在同一模型中整合行动、预测与评估三种能力,形成生成动作、预测后果、评估结果、更新策略的闭环,探索递归自我改进(RSI)。真机测试中,手机放置与多指操作两项任务基础策略平均成功率 65%,加入规划升至 67.5%,加入基于模型的强化学习达 72.5%,两者结合达 75%。
推荐理由:生数 Motus2 把动作生成、后果预测与价值评估放进同一世界模型,读者可了解闭环自进化的实现路径与真机数据。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 的 LoRA 适配器同步,在 HF Jobs 上把训练与 vLLM 推理拆到不同机器,通过挂载 Storage Bucket 传递几 MB 的 rank-1 适配器,无需 NCCL。
推荐理由:原文给出跨机异步 GRPO 训练的可复用工程方案与五轮调优数据,读者可据此判断瓶颈定位与提速路径。
SteadyTray 提出分层强化学习架构 ReST-RL,将运动与负载稳定解耦,在宇树 G1 人形硬件上实现零样本仿真到真实迁移,可应对多种物体与外力扰动。Agility Robotics 的视频展示了人形机器人拖动沙发的场景。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士于9月2日正式加入星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。他将参与星尘具身模型、机器人强化学习及后训练体系建设,与AI模型、具身OS和绳驱机器人本体形成协同,推动强化学习融入真实机器人的训练与部署。
2025年9月从斯坦福回到清华的徐梦迪,成为清华姚班2026级四位新生班主任之一,并在迎新现场带来「构建下一代智能」主题分享。她本科毕业于清华车辆工程专业,2024年获CMU机械工程博士学位,博士论文《构建可适应的通用机器人》拿下CMU机械工程系最佳博士论文奖,主张通用机器人不能只靠Scaling,还需具备adaptation适应能力。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Hugging Face 发布开源鸭子机器人 Microduck,售价 399 美元,圣诞节前发货。这款高 25 厘米的机器人能摇摆行走、用喙叼取物品、跌倒后自行站起、蹲下甚至滑旱冰,通过摄像头、激光雷达和两个 IMU 感知环境。Pollen Robotics 表示其行为可在仿真中训练并直接部署到机器人上,SDK、仿真和完整强化学习训练栈已在 GitHub 开放。
无界动力在2026世界机器人大会上集中展示以隐空间世界模型为核心的具身通用大脑MWA™,并提出“隐空间世界模型+强化学习”技术路线。创始人张玉峰称世界模型价值在于推演行动如何改变世界,公司主张“用工业练技能、用商业练泛化”。CTO夏中谱认为具身智能仍处“诸子百家”早期阶段,产品解决方案总经理沈明达则提出工业产线自动化从G1到G5的五级进化。
8月21日世界机器人大会期间,星海图举办“从模型到生产力”技术与产业应用论坛,首席科学家赵行介绍G0.5基础模型内嵌原生动作思维链,并预告G0.5 MAX即将发布,同时启动G0.5复现计划,开放模型权重、推理接口、评测基准与微调工具。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
ROS 社区下一次 8 月会议将讨论如何用 Gazebo 运行强化学习算法。Gym Gazebo Sim 是一个教育软件工具包,用于帮助初学者上手。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
团队发布 gym-gazebo-sim,将 erlerobotics 在 ROS1 与 Gazebo Classic 上的 gym-gazebo 框架移植到 ROS2 Jazzy 与 Gazebo Sim Harmonic,用于训练强化学习智能体。该工具设计为可在低性能电脑上运行,将用于其机器人学本科入门课程,并会随使用持续演进。
RSS 2026 公布论文奖项,共收到 708 篇投稿、录用 210 篇,接收率 29.7%,8 篇进入 Final List 后评出三项最佳论文。