Revisiting Large Language Model Pruning using Neuron Semantic Attribution

重新审视使用神经元语义归因的大语言模型剪枝

发布于ICML2025 2025.3

论文链接:[2503.01542] Revisiting Large Language Model Pruning using Neuron Semantic Attribution

  • 简介

大语言模型(LLMs)在自然语言处理任务中表现出色,但其推理阶段的高计算成本限制了实际部署。模型剪枝是一种有效的压缩方法,通过移除不重要的权重或神经元来减少模型大小和计算量。然而,现有剪枝方法在多样化任务和数据集上的泛化能力尚不明确,尤其是在校准数据选择对剪枝效果的影响方面缺乏系统研究。

此外,作者发现某些任务(如情感分类)在剪枝后性能下降显著,而传统方法难以解释这一现象。为此,本文提出了一种名为 Neuron Semantic Attribution(NSA) 的方法,用于分析剪枝对神经元语义关联的影响。

之所以阅读此篇论文,是因为上一篇论文(Brain-Inspired Exploration of Functional Networks and Key Neurons in Large)提到了关于减少神经元数量也可以实现相同功能,让我很感兴趣。

  • 实验

1、实验目的

评估三种剪枝方法在海量数据上的表现。

2、实验变量:

三种后训练剪枝方法:spareGPT、wanda、RIA

数据集:24种数据集,涵盖四种场景如下:

情感分类(SST2, Yelp, IMDB, Sentiment140)

问答(ARC-C, ARC-E, BoolQ, PubMedQA等)

语义相似性(MRPC, QQP, SciTail等)

逻辑推理(COPA, LogiQA, SciQ等)

标准数据集:

C4,WikiText2, PTB, ARC-C , ARC-E , BoolQ, RTE, SST2, WNLI

  1. 方法过程

模型剪枝:

使用不同的剪枝方法,在指定的校准数据上,以特定的稀疏比和序列长度,对原始的大语言模型进行剪枝。

性能评估:

将剪枝后的模型在24个下游任务数据集上进行推理,并记录其准确率。

神经元语义归类(NSA):

神经元语义归类(NSA):

Step1:关键词筛选

从评估数据(如Yelp评论)中,利用Chain-of-Thought技术找出对任务决策至关重要的词语(如“badly", "damaged")

Step2:神经元匹配

将原始未剪枝模型输入包含这些词的文本,记录哪些神经元对这些词有高激活,从而建立“神经元-语义”的关联。

使用的公式:

Step3:对比

将同样的文本输入剪枝后的模型,观察在Step 2中找出的关键神经元的激活强度是否发生显著下降。

  1. 实验结果

①标准数据集的影响:校准数据的选择对剪枝效果影响巨大,且因任务而异。情感分类和问答任务对此最敏感,而语义相似性和逻辑推理任务则相对鲁棒。

②剪枝方法比较:SparseGPT 在大多数情况下的综合表现最好、最稳定。

③稀疏比的影响:稀疏比越高,性能越差。

④序列长度的影响:输入序列的长度对剪枝模型的整体平均性能影响非常小。

⑤模型大小的影响:大模型(如LLaMA-13b)对不同校准数据不敏感,性能稳定;小模型(如OPT-6.7b)则波动很大,更依赖好的校准数据。模型越大,对剪枝越鲁棒。

  • 结论

剪枝绝非简单的参数削减,我们要研究清楚大模型内部神经网络的结构,才能更好地压缩大模型的复杂结构,实现效率的提升。

文中用到的校准数据应被视为指导剪枝方向的指导方向,并非无关的参考样本;而NSA这样的可解释性工具,则帮助我们了解了剪枝的内部原理以及大模型的神经网络结构。

然而,在该篇论文的阅读中,我并没有学习到我想要学习的内容:剪枝应该如何选择神经元?剪枝的内部原理是什么?神经元网络作为整体,如何处理剪枝?

在未来,我们可以研究以下方向:

  1. 如何选择剪枝神经元(精准剪枝)。
  2. NSA能够很好地指导剪枝,那么我们是不是可以采用NSA的方法选择神经元?
  3. 实践剪枝,对于具体的LLM。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐