AutoVLA自动驾驶端到端路径轨迹预测模型复现
论文链接:https://arxiv.org/abs/2506.13757
所在会议:NeurIPS 2025
github代码链接:https://github.com/ucla-mobility/AutoVLA
技术点学习:
1、轨迹路径token化:使用聚类k-disk创建动作码本,将连续轨迹离散化为可量化的2048个相对位移,融入语言模型,实现统一自回归推理与规划。
具体而言:将车辆轨迹从全局坐标系转换为单步的自身坐标系,然后以聚类形式划分为2048个token,组合进Qwen的原始词表中,使得Qwen具备输出路径轨迹的能力。
2、采用Qwen2.5-VL作为骨干,通过监督微调,联合思维链与轨迹输入,使模型同时具备场景分析与轨迹预测能力。
具体而言:由于Qwen自身具备较好的视频分析能力,因此冻结Qwen的ViT分支,针对LLM的主干网络、ViT的映射结构等进行分析。此处监督微调的约束设计为原始路径轨迹与预测路径轨迹之间的差距。
3、采用GRPO强化学习算法,以驾驶奖励和思维链长度惩罚驱动,加强快慢思维模式,可自适应减少冗余推理,提升简单场景的响应速度。
具体而言:强化学习的约束设计为PDW scores及思维链长度;强化学习的目的:1、优化驾驶轨迹;2、减少思维链长度,降低推理时长。效果:强化学习前:PDWs 80分;推理时长:3s+;强化学习后:PDWs 89分;推理时长:1.3s*