Brain-Inspired Exploration of Functional Networks and Key Neurons in Large Language Models

大脑启发的大语言模型功能网络和关键神经元探索

布于arxiv(暂未发布) 2025.2

论文链接:[2502.20408] Brain-Inspired Exploration of Functional Networks and Key Neurons in Large Language Models

代码链接:WhatAboutMyStar/LLM_ACTIVATION: The implement of "Brain-Inspired Exploration of Functional Networks and Key Neurons in Large Language Models" and "Pruning Large Language Models by Identifying and Preserving Functional Networks"

  • 简介

现有的大语言模型可解释性研究多集中于识别和解读单个神经元的功能,但这忽略了一个关键事实:无论是人脑还是人工智能,高级功能的实现都依赖于神经元群体之间复杂的交互网络。受认知神经科学中功能脑网络 研究的启发,本论文提出了一种创新的方法,旨在探究大语言模型内部是否也存在类似的功能网络。研究者将fMRI信号分析技术(特别是独立成分分析ICA)应用于LLM的神经元输出,成功地发现并验证了这些功能网络的存在性与关键作用。

  • 预备知识
  1. MLP

MLP层是进行非线性变换的关键部位,它通常由两个全连接层构成。

第一个层将输入维度放大,随后是一个非线性激活函数,第二个层将维度缩小回原始大小。

其中,W 是权重矩阵,b 是偏置向量,σ 是非线性激活函数。

  1. FBNs(功能脑网络)

功能脑网络是指在执行特定任务或静息状态下,协同激活的一组脑区。

  1. ICA(独立成分分析)

ICA是一种强有力的数据驱动技术,用于从混合信号中提取尽可能统计上独立的源信号。

FastICA被本文采用为从LLM数据中提取功能脑网络的方法,算法过程如下:

  1. 预白化

将中心化后的数据进行线性变换,使得新信号的各分量不相关且具有单位方差。

V 和 E 分别是 X的协方差矩阵的特征向量和特征值矩阵

  1. 寻找独立成分

对于每一个要提取的独立成分wi,我们最大化以下目标函数:

z是白化后的数据,G是非线性函数,通常从下面两个中选一个:

为了寻找最优的w,FastICA使用定点迭代:

3、正交化

为了防止不同的Wi收敛到同一个成分,在每次迭代后需要进行正交化

当需要提取多个(m个)独立成分时,在每次为一个新的wi进行迭代之前,需要与之前已找到的所有 W1,W2...,Wi−1 进行正交化。(对称正交化)

4、恢复源信号与混合矩阵

  • LLM中的功能网络
  1. 实验设置

数据集:

AGNEWS:新闻文章

Wikitext2:百科全书条目

MathQA:数学文本

CodeNet:代码片段

模型:GPT-2、Qwen2.5-3B-Instruct 和 ChatGLM3-6B-base

  1. 从LLM中提取功能网络

在神经科学研究中,功能网络通常通过fMRI(功能性磁共振成像)信号推导而来,这些信号反映了神经元对各类刺激的反应活动。

LLM神经元的输出信号与fMRI信号之间存在显著的相似性,因此,我们可以将用于分析fMRI信号的技术方法应用于LLM模型。

信号源:模型MLP层在处理上述输入文本时产生的神经元激活值。

分析方法:

个体分析:ICA应用于单个受试者的fMRI数据

群体分析:将所有受试者的数据整合成一个大型数据矩阵,再对合并后的数据集进行ICA分析。

  1. 验证功能网络的空间一致性

我们通过交并比来评估功能网络的相似性。

我们发现,即使在不同的输入样本下,LLMs中依然存在大量与模板相似的功能网络。这强有力地证明了功能网络在LLMs中是稳定、可重复出现的实体。

  1. 功能网络可视化

首先,每个功能网络仅由神经元总数中占比极低的一小部分构成,印证了LLM神经元稀疏激活的特性;

其次,相似的网络能够从新闻、代码等不同类型数据中稳定提取,表明它们是模型内部固有的、跨任务协同的专用功能模块;

更关键的是,这些网络在深层模型中分布更为集中,暗示高级抽象处理依赖于深层神经元间的功能连接,而这一组织原则与人脑中默认模式网络等多任务功能网络的存在具有深刻的相似性。

  • 评估功能网络的重要性
  1. 实验设置

仍然是采用GPT-2、Qwen2.5-3B-Instruct 和 ChatGLM3-6B-base三个大模型

数据集:

GLUE:通用语言理解评估基准。

SQuAD:斯坦福问答数据集。

AGNews:新闻分类数据集。

  1. 评估指标

分类任务:准确率

问答任务:F1分数

  1. 神经元损伤实验

选择性地掩码(即将激活输出置零)一个或多个在第三节中通过ICA识别出的特定功能网络中的所有神经元。

实验结果:性能急剧下降。

这强有力地证明了功能网络中的神经元是功能专一且不可替代的,其重要性源于其特定的协同组织模式,而非偶然。

  1. 神经元保留实验

该实验反其道而行之。不是掩码网络,而是仅保留由ICA分解出的前K个功能网络中的所有神经元,并掩码掉模型中所有其他神经元。随后,逐步增加K(即保留更多的功能网络),观察模型性能的变化。

实验结果:随着保留的功能网络数量增加(即保留的神经元总数增加),模型性能从低到高逐渐恢复。最终,仅保留约10%的神经元(即所有关键功能网络的集合),就足以使模型性能恢复到与原始完整模型相当的水平。

这表明LLM的功能实现依赖于一个稀疏但高效的核心神经元子集,这些功能网络共同构成了模型的 “功能骨干”。

  • 思考与启示

这篇论文引导我们整体来看神经网络,而不是仅仅看某个神经元。,这让我们对与LLM内部机制有了更深刻的了解(不过也符合直观印象)。

在未来,我们可以研究以下几个方向:

  1. 轻量化模型:文章实验证明了,仅仅保留百分之十的神经元即可实现原模型水平,所以我们可以思考减少神经元数量来轻量化模型。
  2. 与医学相结合(神经科学):文中提到的fMRI以及交并比都是神经科学的内容,计算机神经元与医学上的神经元有很多相似之处,值得我们思考。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐