PRICE:面向具身强化学习的物理关系信用分配方法
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。
推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。
DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。
推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。
论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。
推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。
研究提出一种倒置的堆叠方式,先训练通用的指令条件化运动策略作为底层,再在其上叠加 N 个运动引导的踢球技能作为任务门控层,使可达步态空间由运动课程而非参考片段决定。
推荐理由:论文把运动策略作为底层、踢球技能作为任务门控层,并给出多方向射门与地形、推力恢复的评测结果。
CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。
推荐理由:论文提出人形机器人末端执行器与根部的方向可调柔顺框架,读者可了解分层强化学习如何调制全身跟踪策略。
TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。
研究者设计了一个"无人机足球"任务,探索主动利用多旋翼螺旋桨下洗流进行操作的可行性。他们建立简化下洗流动力学模型,据此训练强化学习策略完成带球动作,并证明该策略可迁移到真实世界部署。
一项研究将2D仿真中共进化出的通信协议直接迁移到3D物理环境,不重新训练网络权重,用两台e-puck型机器人(GRU网络加残差连接)执行带社交信号的觅食任务。迁移前需三处修正,包括依据残差权重可测不对称性校准饥饿项;即便如此迁移仍部分且不对称,三十个测试种子中仅一个智能体到达食物源。在社交通道加入显式方向信息可改变接收方轨迹并改善个别案例,但仍不足以让第二个智能体到达食物源。
该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。
推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。
SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。
推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。
研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。
推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。
Hugging Face 上线 strands-isaaclab-h1-rough 数据集,记录宇树 19 自由度 H1 人形机器人在 NVIDIA Isaac Lab 程序化崎岖地形上按指令基座速度行走,共 12 条 episode、6000 帧、50 fps。
该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。
推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。
ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。
论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。
推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。
星尘智能基座模型团队发布在线强化学习框架 SmoothRL,用于大模型异步推理成为真实部署常态后的策略后训练。它把 action chunk 按执行状态分为已提交、执行和丢弃三个区域,只让梯度穿过真正执行的 Execution Region,并在训练 rollout 中直接运行异步推理。
论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。
Florent Delgrange 凭《Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments》获 AAMAS 2026 最佳蓝天空论文奖。
Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。
推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。
WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。
推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。
论文提出 PCSD(Persistent Consistency for Self-Distillation),用于 Agentic 强化学习中的自蒸馏,通过持续一致性机制改进训练。目前该论文页面已在 Hugging Face 上线并开放讨论。
研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。
Hugging Face 论文页介绍 Molt,一个面向智能体强化学习的可扩展 PyTorch 原生训练框架。该页面目前仅开放论文讨论,未披露模型规模、任务成功率或真机部署等具体结果。
一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。
RSS 2026 公布论文奖项,共收到 708 篇投稿、录用 210 篇,接收率 29.7%,8 篇进入 Final List 后评出三项最佳论文。
一项在 ALFWorld 上用 Qwen2.5-0.5B-Instruct 做的稀疏奖励智能体强化学习研究显示,在 GiGPO 下仅对隐藏权重矩阵应用 Muon,可将最终窗口验证成功率从 0.290 提升到 0.546(+88%),而高学习率 AdamW 对照组更新后无成功率保留。
Rank-Then-Act(RTA)提出一种无需手工奖励函数的强化学习控制方法,通过训练视觉语言模型从打乱顺序的视频帧中识别任务进度,并将该进度信号作为强化学习的唯一奖励。该方法不依赖人工设计奖励函数,也不使用稀疏环境信号。
纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。
Sony AI 开发的自主乒乓球机器人 Ace 在测试中五场赢下三场,对手是训练十年以上、每周约 20 小时的精英选手,但对阵日本职业联赛选手两场均告负,仅赢下一局,相关系统细节发表在 Nature 论文中。
BAIR 博客介绍了一种不基于时序差分(TD)学习的强化学习范式:分治价值学习,并给出具体算法 Transitive RL(TRL)。
推荐理由:作者以第一人称梳理分治价值学习如何绕开 TD 的误差累积,并给出在 OGBench 长程任务上的对比结果。