跳到正文

#强化学习

今日 11 条
今天10月1日周四
  1. arXiv cs.RO62

    PRICE:面向具身强化学习的物理关系信用分配方法

    PRICE 提出用轨迹间的物理关系为动作块分配信用,仅凭终端成功信号即可细化轨迹级监督,无需辅助评估器。方法包含物理关系图与置信度门控信用分配两部分,并给出与终端成功目标相关的有限样本方向界。在 LIBERO、RoboTwin 2.0 和真机实验中,PRICE 相比基于结果的基线任务成功率更高、学习更快。

    推荐理由:提出用轨迹间物理关系为动作块分配信用,无需额外评估器,并在 LIBERO、RoboTwin 2.0 与真机上验证。

  2. arXiv cs.RO62

    DODGER:面向动态障碍物导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,训练时直接执行策略生成的动作驱动 rollout,同时用控制屏障函数(CBF)过滤后的参考和约束违反来塑造避障行为,以避免仅执行安全过滤动作限制策略探索。作者通过 Dubins 车安全分析评估该方法,并在全阶人形仿真和基于 LiDAR 感知的真实人形实验中实现多动态障碍物下的目标导向导航,且不使用运行时安全过滤器。

    推荐理由:论文提出训练时直接执行策略动作、用 CBF 参考塑造避障行为,并在人形仿真与真机验证。

  3. arXiv cs.RO62

    Online-ES:通过自监督轨迹分布优化在线进化 Flow Matching VLA 策略

    论文提出 Online-ES,一个基于进化策略的 Flow Matching VLA 在线自适应框架,通过在动作轨迹空间做进化探索并利用执行结果构建自监督 MSE 目标,把进化方向从轨迹空间迁移到模型参数空间。作者证明该目标是最优进化方向的无偏估计,并将失败经验作为负反馈约束进化方向。仿真与真实环境实验显示,其策略改进效果与强化学习微调相当,且无需学习价值模型或计算优势函数。

    推荐理由:提出在动作轨迹空间做进化搜索的在线自适应框架,为 Flow Matching VLA 策略改进提供不依赖价值模型的方法。

  4. arXiv cs.RO62

    基于运动策略的人形机器人足球:多方向踢球技能库的任务门控强化学习

    研究提出一种倒置的堆叠方式,先训练通用的指令条件化运动策略作为底层,再在其上叠加 N 个运动引导的踢球技能作为任务门控层,使可达步态空间由运动课程而非参考片段决定。

    推荐理由:论文把运动策略作为底层、踢球技能作为任务门控层,并给出多方向射门与地形、推力恢复的评测结果。

  5. arXiv cs.RO62

    CEER2:面向人形机器人移动操作的方向可调末端执行器与根部柔顺框架

    CEER2 提出一种面向人形机器人移动操作的柔顺框架,将方向可调、可在线调整的末端执行器柔顺与可选根部柔顺结合,用于外力抑制或力跟随。该框架用分层强化学习控制器通过高层末端执行器与根部指令调制固定的全身跟踪策略,交互力由本体感知历史估计。仿真与真机实验展示了方向刚度控制、在线刚度调整、不同根部柔顺模式、柔顺操作与协作搬运。

    推荐理由:论文提出人形机器人末端执行器与根部的方向可调柔顺框架,读者可了解分层强化学习如何调制全身跟踪策略。

  6. arXiv cs.RO58

    TERRA:面向肌肉骨骼行走的地形感知重建、重定向与控制流程

    TERRA 是一个面向肌肉骨骼行走的地形感知重定向与控制端到端流程,仅从运动学轨迹出发,结合地形先验、估计接触与负自由空间证据恢复任务相关的支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。作者用五个数据集生成的运动-地形配对,在 9.4 小时多样化行走数据上训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升了地形精度、显著减少解剖与交互违规,并在所支持的各类地形上取得最高完成率。

  7. arXiv cs.RO34

    进化机器人中共进化通信的行为持续性及功能迁移不完整

    一项研究将2D仿真中共进化出的通信协议直接迁移到3D物理环境,不重新训练网络权重,用两台e-puck型机器人(GRU网络加残差连接)执行带社交信号的觅食任务。迁移前需三处修正,包括依据残差权重可测不对称性校准饥饿项;即便如此迁移仍部分且不对称,三十个测试种子中仅一个智能体到达食物源。在社交通道加入显式方向信息可改变接收方轨迹并改善个别案例,但仍不足以让第二个智能体到达食物源。

  8. arXiv cs.RO62

    Memorize, Adapt, Ignore:诊断训练数据变化下的机器人学习机制

    该研究用经验神经正切核(NTK)作为诊断工具,考察训练数据变化如何影响机器人操作策略的内部学习机制。在 ManiSkill 的 pick-and-place 强化学习以及 LIBERO、RoboTwin 上 VLA 模型微调中,随机化物体尺寸、颜色、类型、场景光照和语言提示,NTK 能区分策略是在记忆不同情形、适应具体情形,还是忽略任务无关因素。

    推荐理由:用经验神经正切核区分策略是在记忆、适应还是忽略训练数据变化,为域随机化设计提供可操作的诊断信号。

  9. arXiv cs.RO60

    SynIL:利用运动协同度从不完美示范数据集中做离线模仿学习

    SynIL 是一个面向离线模仿学习的自动化、免标注示范质量评估框架,基于运动协同度这一低维协调结构与运动熟练度相关的神经科学证据,通过自监督奖励回归生成密集的逐 transition 奖励信号。在 D4RL 运动基准和多人类 Robomimic 操作数据集上,协同度导出的奖励与真实奖励强相关,性能显著优于行为克隆(BC),与使用真实环境奖励训练的离线强化学习相当,在稀疏奖励的人类遥操作场景中更优。

    推荐理由:提出用运动协同度自动评估示范质量并生成奖励信号,为不完美示范数据集的离线模仿学习提供免标注思路。

  10. arXiv cs.RO60

    螺旋软体机器人全身抓取与抛掷的优化学习精炼框架

    研究提出面向软体连续机器人的优化-学习-精炼框架,用基于结果的动作空间优化实现从初始未抓取状态开始的全身抓取与拾取抛掷。抓取以末端角扫掠和身体-物体包裹度量化,抛掷还纳入释放方向对齐与最低释放速度,采用无导数CMA-ES应对非光滑的动作到结果映射。

    推荐理由:论文给出软体连续机器人全身抓取与抛掷的无导数优化框架,并附仿真与真机成功率数据。

9月30日周三
  1. arXiv cs.RO62

    受被动动态行走启发的动力学引导方法提升人形机器人行走能效

    该论文提出一种受被动动态行走(PDW)启发的框架,在训练早期用倾斜重力场辅助矢状面行进,并在正式动力学优化前移除全部 PDW 引导,无需参考轨迹、步态相位或接触时序。

    推荐理由:论文给出一种受被动动态行走启发的训练引导方法,并报告了在 29 自由度 Unitree G1 上的能耗与真机结果。

9月20日周日
  1. Hackaday robots55

    ETH Zurich 让机器人手用手指行走

    ETH Zurich 研究人员把一只商用机器人手改造成能用手指行走的装置,为其加装电池和 Raspberry Pi Zero 2 W,并开发神经网络控制软件。该手有 20 个关节、每指 4 个,网络根据先前动作、手部状态和当前目标迭代输出下一关节状态;训练先在仿真模型中进行强化学习,行走速度快于改造的四足运动模型。

9月11日周五
  1. HF blog62

    论文提出 World Model RL,用世界模型加速自动研究智能体后训练

    论文提出 World Model RL(WMRL),用学习到的世界模型替代环境执行,以缓解自动研究智能体强化学习后训练中环境执行成为瓶颈的问题。作者进一步引入 Online Debiasing 与 Inverse-Variance Denoising 分别抵消世界模型奖励的偏差与噪声,并从理论上证明两者严格改善收敛保证。

    推荐理由:论文提出用世界模型替代环境执行来加速自动研究智能体的强化学习后训练,并给出理论收敛保证与跨任务迁移证据。

9月4日周五
8月28日周五
  1. HF blog24

    Agentic Game Development 作为可验证轨迹数据引擎:为世界模型扩展提供数据

    论文提出将智能体游戏开发用作可验证的轨迹数据引擎,以扩展世界模型训练数据。作者质疑"不崩溃"作为奖励信号的价值:能编译运行的游戏未必在第一关之后保持连贯,基于"未崩溃"奖励的强化学习会优化出平淡安全的场景。真正的问题是这种信号能否带来空间一致性,生成轨迹需经人类试玩检验,而非仅通过运行时检查。

8月21日周五
8月19日周三
  1. HF blog78

    NeDM Study 4 数据集发布:宇树 Go2 在 CRM 颗粒地形上的神经降维动力学复现材料

    Hugging Face 上发布 NeDM Study 4 数据集,包含宇树 Go2 在 Chrono CRM 颗粒地形(SPH 颗粒土壤)上行走的语料、训练好的神经降维代理模型。

    推荐理由:论文配套数据集公开了宇树 Go2 在颗粒地形上的语料、代理模型与微调策略,可复现其仿真到真实迁移流程。

8月6日周四
  1. HF blog71

    WorldCycle:用可逆动作循环自监督强化学习训练长时程视频世界模型

    WorldCycle 提出用可逆动作循环作为可自验证的强化学习信号,无需真值轨迹,将长时程状态回归漂移最多降低 44%,复合动作准确率提升近 4 倍。作者指出 WorldPlay、WorldCompass 等基线存在空间闭合失败与时间一致性失败,且短时程奖励无法察觉。团队同时发布 CycleBench,覆盖短、中、长时程的可逆、重复与复合循环,用于把视频世界模型当作模拟器评测。

    推荐理由:作者把可逆动作循环当作无需真值轨迹的自监督信号,并公开 CycleBench,读者可据此理解长时程视频世界模型的漂移评测方式。

8月5日周三
7月28日周二
  1. HF blog44

    多轮长时程规划的物理学:从预训练到后训练的单教师与多教师在线策略智能体蒸馏

    研究者提出一个可控多轮环境,系统研究基础模型智能体长时程规划的获取、塑造与整合三阶段。预训练阶段,通过 CoT 状态转移建模显式构建世界模型可带来更强的长时程泛化,仅靠原子技能不足以实现组合泛化,而少量长时程数据即可奏效。后训练阶段,OPD 在低质量与长时程设定下有效区域比 GRPO 更广,多教师在线策略蒸馏(MOPD)则通过收敛到跨环境共享规划模式来整合能力。

  2. HF blog43

    机器人学习中的进度奖励建模:一篇综合性综述

    一篇综述统一了机器人学习中的进度奖励建模,从模型接口、内部构建方法与评估基准三个层面梳理该领域。综述指出,终端成功信号无法说明机器人当前行为是在推进、停滞还是倒退,因此近期研究转向任务执行中提供反馈的进度奖励,但现有方法在观测、目标设定、输出信号、监督来源和评估协议上各不相同,难以比较。综述还总结了当前方法的主要局限并讨论了未来方向。

7月20日周一
7月8日周三
7月5日周日
  1. qbitai71

    纽约大学联合LeCun团队提出AdaJEPA,让世界模型学会持续学习

    纽约大学联合LeCun初创AMI提出JEPA系列新成果AdaJEPA,通过测试时自适应在交互中实时调整世界模型的编码器和预测器参数,实现持续学习。它采用计划、执行、观测、更新、再规划的闭环,每次只执行MPC规划的第一段动作,并用真实下一帧状态作自监督信号更新模型,默认只更新视觉编码器和预测器最后几层、每次重规划做1步梯度下降。

5月18日周一
11月1日周六