重新审视使用神经元语义归因的大语言模型剪枝
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
重新审视使用神经元语义归因的大语言模型剪枝
发布于ICML2025 2025.3
论文链接:[2503.01542] Revisiting Large Language Model Pruning using Neuron Semantic Attribution
- 简介
大语言模型(LLMs)在自然语言处理任务中表现出色,但其推理阶段的高计算成本限制了实际部署。模型剪枝是一种有效的压缩方法,通过移除不重要的权重或神经元来减少模型大小和计算量。然而,现有剪枝方法在多样化任务和数据集上的泛化能力尚不明确,尤其是在校准数据选择对剪枝效果的影响方面缺乏系统研究。
此外,作者发现某些任务(如情感分类)在剪枝后性能下降显著,而传统方法难以解释这一现象。为此,本文提出了一种名为 Neuron Semantic Attribution(NSA) 的方法,用于分析剪枝对神经元语义关联的影响。
之所以阅读此篇论文,是因为上一篇论文(Brain-Inspired Exploration of Functional Networks and Key Neurons in Large)提到了关于减少神经元数量也可以实现相同功能,让我很感兴趣。
- 实验
1、实验目的
评估三种剪枝方法在海量数据上的表现。
2、实验变量:
三种后训练剪枝方法:spareGPT、wanda、RIA
数据集:24种数据集,涵盖四种场景如下:
情感分类(SST2, Yelp, IMDB, Sentiment140)
问答(ARC-C, ARC-E, BoolQ, PubMedQA等)
语义相似性(MRPC, QQP, SciTail等)
逻辑推理(COPA, LogiQA, SciQ等)
标准数据集:
C4,WikiText2, PTB, ARC-C , ARC-E , BoolQ, RTE, SST2, WNLI
- 方法过程
模型剪枝:
使用不同的剪枝方法,在指定的校准数据上,以特定的稀疏比和序列长度,对原始的大语言模型进行剪枝。
性能评估:
将剪枝后的模型在24个下游任务数据集上进行推理,并记录其准确率。
神经元语义归类(NSA):
神经元语义归类(NSA):
Step1:关键词筛选
从评估数据(如Yelp评论)中,利用Chain-of-Thought技术找出对任务决策至关重要的词语(如“badly", "damaged")
Step2:神经元匹配
将原始未剪枝模型输入包含这些词的文本,记录哪些神经元对这些词有高激活,从而建立“神经元-语义”的关联。
使用的公式:

Step3:对比
将同样的文本输入剪枝后的模型,观察在Step 2中找出的关键神经元的激活强度是否发生显著下降。
- 实验结果
①标准数据集的影响:校准数据的选择对剪枝效果影响巨大,且因任务而异。情感分类和问答任务对此最敏感,而语义相似性和逻辑推理任务则相对鲁棒。
②剪枝方法比较:SparseGPT 在大多数情况下的综合表现最好、最稳定。
③稀疏比的影响:稀疏比越高,性能越差。
④序列长度的影响:输入序列的长度对剪枝模型的整体平均性能影响非常小。
⑤模型大小的影响:大模型(如LLaMA-13b)对不同校准数据不敏感,性能稳定;小模型(如OPT-6.7b)则波动很大,更依赖好的校准数据。模型越大,对剪枝越鲁棒。
- 结论
剪枝绝非简单的参数削减,我们要研究清楚大模型内部神经网络的结构,才能更好地压缩大模型的复杂结构,实现效率的提升。
文中用到的校准数据应被视为指导剪枝方向的指导方向,并非无关的参考样本;而NSA这样的可解释性工具,则帮助我们了解了剪枝的内部原理以及大模型的神经网络结构。
然而,在该篇论文的阅读中,我并没有学习到我想要学习的内容:剪枝应该如何选择神经元?剪枝的内部原理是什么?神经元网络作为整体,如何处理剪枝?
在未来,我们可以研究以下方向:
- 如何选择剪枝神经元(精准剪枝)。
- NSA能够很好地指导剪枝,那么我们是不是可以采用NSA的方法选择神经元?
- 实践剪枝,对于具体的LLM。
更多推荐


所有评论(0)