自动驾驶大模型---FastDriveVLA
1 背景
本篇博客主要介绍北京大学和小鹏汽车联合发表的文章。作者主要从两个方面阐述目前VLA的问题:
-
端到端自动驾驶的挑战
-
现有基于视觉-语言-动作(VLA)模型的端到端自动驾驶系统,需将图像转换为大量视觉token输入大语言模型(LLM),导致计算开销剧增。
-
传统token剪枝方法(如基于相似性或注意力)在驾驶场景表现不佳:相似性剪枝忽略语义重要性,注意力剪枝依赖文本对齐且需模型重训练,无法适应动态驾驶环境。
-
-
人类驾驶的启发
人类驾驶员仅关注与决策相关的前景区域(如车辆、行人、交通灯),而忽略背景冗余信息。论文据此提出:保留前景相关token是提升自动驾驶决策效率的关键。
2 FastDriveVLA框架
(1)工作原理
-
采用MAE式像素重建:通过对抗性训练分离前景与背景信息,迫使剪枝模块优先保留对驾驶决策至关重要的前景token。
-
对抗性训练策略:
-
前景分支:重建前景区域像素,强化对关键物体(如车辆、行人)的识别。
-
背景分支:重建背景区域,避免无关信息干扰决策。
-
-
即插即用特性:训练完成后可直接接入同视觉编码器的不同VLA模型,无需重训练或微调。

(2)nuScenes-FG数据集
-
数据构成:
-
基于nuScenes数据集扩展,包含24.1万张图像-掩膜对,标注驾驶关键前景区域(车辆、行人、交通标志等)。
-
覆盖复杂场景:雨雾天气、夜间交叉路口、施工路段等长尾场景。
-
-
标注规范:
-
前景掩膜由规则过滤+人工校验生成,确保标注一致性与可靠性。
-
3 实验
(1)评估基准与指标
-
数据集:nuScenes闭环规划基准(侧重实时决策与轨迹准确性)。
-
对比方法:
-
相似性剪枝(e.g., Token Merging)
-
注意力剪枝(e.g., AdaViT)
-
无剪枝基线(原始VLA模型)。
-
(2)性能结果
从下面三个指标的结果来看,还是取得了不错的效果。

4 总结
FastDriveVLA通过重构式token剪枝与对抗前景学习,实现了自动驾驶VLA模型的高效推理,其核心价值在于:
算法创新:首次将像素重建损失引入token剪枝,建立驾驶场景的前景-背景分离范式。
工程友好:即插即用设计显著降低部署门槛,推动端到端驾驶落地。
未来工作可探索无监督前景学习与动态剪枝率机制,进一步提升开放场景适应性。
参考文献:
《FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning》
更多推荐



所有评论(0)