跳到正文
原文
arXiv cs.RO· Chenglin Chen, Lujia Wang, Xinhu Zheng, Jun Ma, Haoang Li·· 6 小时前AI 评分43

EMPlan:面向自动驾驶的奖励引导偏好优化高效多模态规划

Efficient Multi-Modal Planning with Reward-Guided Preference Optimization for Autonomous Driving

AI 导读

研究者提出 EMPlan,一种由奖励引导微调驱动的高效多模态轨迹规划方法,采用稀疏锚点加偏移精修模块的混合架构,稀疏锚点以低时延给出粗轨迹候选,再由偏移模块精修提升精度。方法采用预训练加奖励引导微调的两阶段训练,利用规则奖励信号与非成对偏好监督,在不增加推理成本的前提下提升安全性。在非反应式 NAVSIM 基准上,EMPlan 在实时约束下兼顾了规划精度与效率。

来源:arXiv cs.RO · arxiv.org