1 背景

        本篇博客主要介绍北京大学和小鹏汽车联合发表的文章。作者主要从两个方面阐述目前VLA的问题:

  • 端到端自动驾驶的挑战

    • 现有基于视觉-语言-动作(VLA)模型的端到端自动驾驶系统,需将图像转换为大量视觉token输入大语言模型(LLM),导致计算开销剧增。

    • 传统token剪枝方法(如基于相似性或注意力)在驾驶场景表现不佳:相似性剪枝忽略语义重要性,注意力剪枝依赖文本对齐且需模型重训练,无法适应动态驾驶环境。

  • 人类驾驶的启发

        人类驾驶员仅关注与决策相关的前景区域(如车辆、行人、交通灯),而忽略背景冗余信息。论文据此提出:保留前景相关token是提升自动驾驶决策效率的关键

2 FastDriveVLA框架

(1)工作原理

  • 采用MAE式像素重建:通过对抗性训练分离前景与背景信息,迫使剪枝模块优先保留对驾驶决策至关重要的前景token。

  • 对抗性训练策略

    • 前景分支:重建前景区域像素,强化对关键物体(如车辆、行人)的识别。

    • 背景分支:重建背景区域,避免无关信息干扰决策。

  • 即插即用特性:训练完成后可直接接入同视觉编码器的不同VLA模型,无需重训练或微调。

(2)nuScenes-FG数据集

  • 数据构成

    • 基于nuScenes数据集扩展,包含24.1万张图像-掩膜对,标注驾驶关键前景区域(车辆、行人、交通标志等)。

    • 覆盖复杂场景:雨雾天气、夜间交叉路口、施工路段等长尾场景。

  • 标注规范

    • 前景掩膜由规则过滤+人工校验生成,确保标注一致性与可靠性。

3 实验

(1)评估基准与指标

  • 数据集:nuScenes闭环规划基准(侧重实时决策与轨迹准确性)。

  • 对比方法

    • 相似性剪枝(e.g., Token Merging)

    • 注意力剪枝(e.g., AdaViT)

    • 无剪枝基线(原始VLA模型)。

(2)性能结果

        从下面三个指标的结果来看,还是取得了不错的效果。

4 总结

        FastDriveVLA通过重构式token剪枝对抗前景学习,实现了自动驾驶VLA模型的高效推理,其核心价值在于:

        算法创新:首次将像素重建损失引入token剪枝,建立驾驶场景的前景-背景分离范式。

        工程友好:即插即用设计显著降低部署门槛,推动端到端驾驶落地。

        未来工作可探索无监督前景学习动态剪枝率机制,进一步提升开放场景适应性。

参考文献:

《FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning》

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐