跳到正文
原文
HF blog·· 29 天前精选AI 评分62

Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型

Paper page - Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

AI 导读

Qwen-Drive-1.0 是一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,外接 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,规划专家基于共享 VLM 表征生成未来自车轨迹。

推荐理由

Qwen-Drive-1.0 把 3D 感知、视觉问答与运动规划统一在一个 VLM 框架内,并给出分阶段训练配方,可了解自动驾驶基础模型的构建思路。

来源:HF blog · huggingface.co