跳到正文
原文
arXiv cs.RO· Amr Mousa, Rifny Rachman, Neil Karavis, Michele Caprio, Richard Allmendinger·· 2 小时前精选AI 评分62

PROMO:面向四足机器人的偏好条件多目标强化学习

PROMO: Preference-conditioned Multi-Objective Reinforcement Learning for Quadrupedal Robots

AI 导读

PROMO 是一种偏好条件多目标强化学习方法,把指令跟踪、稳定性与能效之间的权衡作为运行时输入交给单一四足运动策略,而非在训练时写死为固定标量奖励。在仿真中采样 100 个偏好,67 个行为在精确 Pareto 支配下非受支配,偏好与目标平均相关性为 0.843。

推荐理由

论文把偏好作为运行时输入交给单一四足运动策略,并给出仿真与 Unitree Go2 上的量化对比,可供关注多目标运动控制的研究者参考。

来源:arXiv cs.RO · arxiv.org