当大模型“读懂“大脑:悟界·Brainμ 1.0如何用Next Token Prediction破译神经信号
一、引言:AI的第三次边界扩张
回顾大模型发展史的底层逻辑,会发现一条清晰的演进脉络:
第一阶段(2020-2023):大语言模型——学会了"预测下一个词",在文本空间中理解语义。
第二阶段(2024-2025):多模态大模型——学会了"预测下一个帧",将图像、视频、音频统一为Token序列,实现了跨模态的理解与生成。代表作是智源的悟界·Emu3.5,2026年1月登上Nature正刊,这也是国内多模态大模型方向的首篇Nature论文[1]。
第三阶段(2026-):神经科学大模型——将Next Token Prediction范式延伸到神经信号领域。2026年6月12日,智源研究院在2026北京智源大会上正式发布悟界·Brainμ 1.0,这是全球首个理解与生成统一的多模态神经科学大模型[2]。
这条演进路线的本质是什么?是AI正在从处理"人类制造的信息"(文本、图像、视频),走向处理"生命本身的信息"(脑信号、神经活动) 。后者比前者的难度高一个数量级——因为脑信号是噪声、稀疏、非稳态、跨个体差异极大的复杂数据。
而Brainμ 1.0证明了:同一个"预测下一个Token"的框架,同样适用于神经科学领域。
二、核心技术创新:Brain Tokenizer——给脑信号"配字幕"
2.1 传统神经科学数据的"巴别塔困境"
在Brainμ之前,神经科学面临一个结构性的数据困境:
| 问题类型 | 具体描述 | 后果 |
|---|---|---|
| 模态异构 | EEG、fMRI、MEG、fNIRS、神经像素探针、双光子钙成像等6类信号,采样率、空间分辨率、信噪比差异显著 | 不同实验数据无法直接比较或联合分析,跨模态融合困难 |
| 个体差异 | 同一人在不同时间或不同个体同一脑区的信号模式存在显著差异 | 小样本统计结果难以泛化,模型训练易过拟合 |
| 数据孤岛 | 全球实验室数据独立采集,缺乏统一的数据格式、标注标准和共享机制 | 数据规模效应无法实现,阻碍大模型训练与跨研究验证 |
简单说:每个实验室都在说自己的"方言",没有一个统一的"普通话"。
2.2 Brain Tokenizer:神经科学领域的"联合国翻译官"
Brain Tokenizer的核心思路极其简洁——把上述所有五花八门的神经信号,统一编码为标准Token序列。
这个思路继承自悟界·Emu3.5的核心理念:无论是什么模态,先压缩成Token,再让模型学习Token之间的关联规律。
具体来说,Brain Tokenizer做了三件事:
① 信号标准化:将不同采样率、不同物理单位、不同时空分辨率的原始神经信号,统一映射到一个固定维度的隐空间中。
② 时序分块:将连续神经信号按时间窗口切分为离散的"神经Token",每个Token代表一段时间窗口内的神经活动模式。
③ 模态对齐:通过对比学习,将神经Token与文字Token、图像Token、视频Token映射到同一语义空间——也就是让模型学会"这种脑信号模式≈那个人正在想一只猫"。
最终效果是:单一模型,同时处理人类、猕猴、小鼠三个物种,EEG、fMRI、MEG、fNIRS、神经像素、钙成像等11种神经信号模态,完成了"跨任务、跨模态、跨个体"的大一统[2]。
2.3 技术路线图
plaintext
原始神经信号(EEG/fMRI/钙成像...)
│
▼
┌─────────────────────┐
│ Brain Tokenizer │ ← 信号标准化 + 时序分块 + 模态对齐
└─────────────────────┘
│
▼
神经Token序列(标准格式)
│
▼
┌─────────────────────┐
│ 预训练大模型(Emu架构)│ ← Next Token Prediction
└─────────────────────┘
│
├──→ 文字描述("被试正在识别面孔")
├──→ 图像生成(重建视觉感知内容)
├──→ 音频输出(还原听觉感受)
└──→ 脑刺激信号(反向生成神经调控参数)
这个架构的关键洞见在于:不再把脑信号分析当作一个专门的信号处理问题,而是当作一个"翻译问题" ——把信号"方言"翻译成Token"普通话",剩下的让大模型自己学。
三、三大突破:数据、物种、范式
3.1 万亿级数据集:BrainToken
模型的能力上限,很大程度上取决于训练数据的规模和质量。
Brainμ 1.0配套发布了全球最大的AI-Ready神经科学数据平台BrainToken,汇聚全球开源神经科学数据并完成全量Token化,总量突破1万亿Token[2]。
这个数字意味着什么?对比一下:
- 现有最大的神经科学数据集,规模约为1000亿Token左右
- BrainToken将其提升了近10倍
- GPU-3(LLM领域的经典训练数据)大约是5000亿Token——BrainToken一个神经科学数据集,规模就超过了整个GPT-3的训练语料
在神经科学领域,过去制约AI发挥作用的最大瓶颈从来不是算法,而是数据太少且太散。采集脑信号成本高昂(一台fMRI设备几千万、一次实验可能只能采集几十分钟的高质量数据),导致模型训练长期处于"小样本学习"的窘境。BrainToken把这个天花板直接抬高了10倍。
3.2 跨物种统一建模**
Brainμ 1.0同时覆盖了三个物种的神经数据:人类、猕猴、小鼠。
这不是简单的数据拼接,背后有一个深刻的生物学假设:所有哺乳动物的大脑,共享同一套底层神经计算原理。
- 人类的神经回路和小鼠的神经回路,在微观层面(神经元放电模式、突触可塑性机制)高度相似
- 猕猴的视觉皮层和人类的视觉皮层,在功能组织方式上几乎同构
- 不同物种的差异主要体现在皮层规模、折叠方式、特定脑区的发达程度上,而非底层信号机制
如果这个假设成立,那么模型在小鼠实验中学会的神经活动模式,理论上可以迁移到人类理解上。这正是Brainμ的跨物种设计逻辑:用小鼠和猕猴的数据弥补人类数据的稀缺,反向提升对人类脑信号的理解能力。
3.3 从"预测下一个Token"到"预测下一个神经状态"
Brainμ延续了智源一脉相承的技术主线条:Next Token Prediction。
这条路线与Sora等"以像素为中心"的视频生成路线最大的不同在于:
| 路线 | 代表模型 | 预测目标 | 核心假设 | 优势 | 局限 |
|---|---|---|---|---|---|
| 以像素为中心 | Sora, Seedance | 预测下一个像素/帧 | 视觉数据包含足够信息 | 视觉质量高、直觉性强 | 计算量巨大,缺乏语义理解 |
| 以语言为中心 | LLM, VLM | 预测下一个词元 | 语言是通用表示层 | 语义理解强,泛化性好 | 丢失了非语言信息 |
| 以Token为中心 | Emu3.5, Brainμ | 预测下一个Token(无论模态) | 离散Token是通用表示 | 统一架构、跨模态泛化 | Tokenizer设计难度高 |
Brainμ的成功,验证了"Token化一切"这条技术路线在神经科学领域的可行性——只要Tokenizer设计得好,任何模态的数据都可以被同一个大模型理解和生成。
四、实证成果:从Science论文到临床应用
4.1 Science正刊:记忆反向调控睡眠
Brainμ不是"纸上模型"。在正式发布前,它已经支撑了一项发表在Science正刊上的重要研究:《Memory Reactivation Underlies Experience-Dependent Adaptive Regulation of Sleep》[3]。
核心发现: 睡眠不是被动的恢复过程——记忆内容会主动参与睡眠的稳态调控。
具体来说:
- 负向记忆再激活(如恐惧、焦虑经历) → 加剧睡眠碎片化,提升机体警觉性
- 正向记忆再激活(如愉快、安全经历) → 显著增强睡眠连续性与抗干扰能力
这个发现为理解"为什么焦虑的人睡不好"提供了一个全新的神经机制视角。
Brainμ在其中的作用:
研究团队利用Brainμ 0版本的多模态编解码能力,处理了小鼠睡眠EEG信号和单细胞双光子钙成像数据。模型在零样本(Zero-shot)场景下实现了跨个体、跨场景的数据分析和验证,帮助研究人员区分"伴随记忆重激活的睡眠"和"非伴随记忆重激活的睡眠"[3]。
这也是AI for Science的经典范式:AI不是替代科学家做判断,而是帮助科学家从海量、高维、异构的数据中发现人眼看不到的规律。
4.2 自动化数据分析:3000晚睡眠数据的"AI+人类专家"双向验证
在与北生所刘清华团队的合作中,Brainμ被用于不同转基因品系小鼠长期睡眠数据的自动化分析。
结果令人印象深刻: - 数据规模:超过3000晚睡眠数据
- 验证方式:模型分析结果与专业睡眠神经科学博士研究生分析结果保持高一致性
- 泛化能力:Zero-shot跨品系泛化,无需针对新转基因品系重新训练
- 长期稳定性:联合华为昇腾超节点,持续支持超10个月的自动化分析[3]
这意味着一个实验室如果引入Brainμ,相当于给每个博士生配了一个24小时不间断、跨品系泛化、一致性等于人类博士水平的数据分析助手。
4.3 临床应用:阿尔茨海默症早期筛查
Brainμ 1.0已与宣武医院开展合作,进行个性化阿尔茨海默病(AD)的早期筛查和诊疗。
为什么这很重要?
阿尔茨海默症目前最大的临床痛点是:确诊时往往已经进入中晚期,错过了最佳干预窗口。 如果能通过脑信号模式筛查,在认知下降出现之前就识别出高风险个体,干预效果会显著提升。
Brainμ的优势在于: - 大规模预训练带来的跨个体泛化能力,可以适配不同年龄、性别、基因背景的人群
- 多模态融合能力,可以同时利用EEG(低成本设备)和fMRI(高精度设备)的数据
- 跨物种迁移能力,小鼠模型的早期病理信号模式可以辅助人类诊断模型的训练
此外,王仲远在智源大会上也透露了另一个极具想象力的应用方向—— “周公解梦” :通过脑信号采集,将一个人的梦境还原并描述出来,初步实验已经取得了非常有趣的结果。
五、代码示例:从概念到实践
下面通过两段代码,展示Brain Tokenizer的核心概念。请注意,这是概念性演示代码,实际Brainμ的实现更加复杂。
5.1 Brain Tokenizer概念实现
python
"""
Brain Tokenizer概念演示——将神经信号编码为Token序列
实际实现更复杂,这个版本展示核心逻辑
"""
import numpy as np
from typing import List, Dict, Tuple
class BrainTokenizer:
"""
将不同模态的神经信号统一编码为标准Token序列
核心三步:信号标准化 → 时序分块 → 模态对齐
"""
def __init__(self, token_dim: int = 768, window_size_ms: int = 100):
self.token_dim = token_dim # 每个Token的维度
self.window_size_ms = window_size_ms # 时间窗口大小(毫秒)
# 不同模态的预处理映射表
self.modality_preprocessors = {
'eeg': self._preprocess_eeg,
5.2 跨模态对齐训练概念
python
"""
对比学习实现跨模态对齐——让神经Token与文字/图像Token映射到同一语义空间
"""
import torch
import torch.nn as nn
import torch.nn.functional as F
class CrossModalAlignment(nn.Module):
"""
跨模态对齐模块
通过对比学习,将神经Token与文字Token、图像Token映射到同一语义空间
"""
def __init__(self, token_dim: int = 768, temp: float = 0.07):
super().__init__()
self.temp = temp # 温度系数
# 不同模态的投影头(将各自模态映射到共享语义空间)
self.neural_proj = nn.Linear(token_dim, token_dim)
self.text_proj = nn.Linear(token_dim, token_dim)
self.image_proj = nn.Linear(token_dim, token_dim)
def contrastive_loss(self, neural_tokens: torch.Tensor,
text_tokens: torch.Tensor) -> torch.Tensor:
"""
对比损失:拉近匹配的神经Token-文字Token对,推远不匹配的
Args:
neural_tokens: (batch, dim) 神经Token
text_tokens: (batch, dim) 对应的文字描述Token
"""
# 投影到共享语义空间
z1 = F.normalize(self.neural_proj(neural_tokens), dim=-1)
z2 = F.normalize(self.text_proj(text_tokens), dim=-1)
# 计算相似度矩阵
logits = torch.mm(z1, z2.t()) / self.temp
batch_size = logits.shape[0]
# 对角线是正样本对(神经Token和对应的文字Token)
labels = torch.arange(batch_size).to(logits.device)
# 对称对比损失(这里只展示一个方向)
loss = F.cross_entropy(logits, labels)
return loss
def forward(self, neural: torch.Tensor, text: torch.Tensor,
image: torch.Tensor) -> torch.Tensor:
"""多模态联合对齐"""
loss_text = self.contrastive_loss(neural, text)
# 可选:神经Token与图像Token的对齐
z3 = F.normalize(self.image_proj(image), dim=-1)
z1 = F.normalize(self.neural_proj(neural), dim=-1)
logits_img = torch.mm(z1, z3.t()) / self.temp
labels = torch.arange(neural.shape[0]).to(neural.device)
loss_image = F.cross_entropy(logits_img, labels)
return loss_text + loss_image
# 训练示意
def train_alignment(model, dataloader, epochs=10):
"""跨模态对齐训练循环"""
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-4)
for epoch in range(epochs):
for batch in dataloader:
# batch包含:神经信号Token、对应文字描述Token、对应图像Token
neural = batch['neural_tokens']
text = batch['text_tokens']
image = batch['image_tokens']
loss = model(neural, text, image)
optimizer.zero_grad()
loss.backward()
optimizer.step()
print(f"Epoch {epoch}: Loss = {loss.item():.4f}")
六、技术路径核心逻辑
6.1 为什么是Token化,而不是信号处理?
传统的脑信号分析,走的是"信号处理→特征提取→统计分类"路线:
plaintext
1 原始信号 → 滤波 → 特征提取(功率谱/相干性/ERPs...) → SVM/CNN分类 → 结果
2
这条路线的问题在于:人工设计的特征,可能根本不是大脑真正使用的编码方式。
Brainμ的路线是:
plaintext
1 原始信号 → Token化 → 大模型自监督学习 → 端到端理解/生成
2
这条路线放弃了"手工设计特征"的假设,让模型自己从大量数据中学习"什么信号模式有意义"。这是深度学习最核心的方法论优势——当数据足够多时,端到端学习的效果几乎总是超过人工特征工程。
6.2 对AI for Science的启示
Brainμ的成功,揭示了一个更普适的规律:基础模型的通用架构,可以迁移到任何一个有"足够数据+统一表征需求"的科学领域。
智源研究院院长王仲远在2026智源大会上总结了一条清晰的路线:
“预测下一个Token → 预测下一个物理状态 → 预测下一个神经状态” [4]
这条路线意味着,智源正在把"Next Token Prediction"作为AI的广义基础设施,推动其向物理世界(世界模型Physis)和生命世界(神经科学模型Brainμ)双向延伸。
七、应用落地与未来展望
7.1 近景(1-2年):辅助科研 + 临床辅助诊断
- 神经科学实验室:自动分析EEG/fMRI数据,辅助科研假设验证
- 精神类疾病筛查:抑郁症、焦虑症的客观脑信号辅助诊断
- 阿尔茨海默症早期筛查:与宣武医院合作的个性化筛查方案
7.2 中景(3-5年):脑机接口 + 神经调控 - 消费级脑机接口:Brainμ已与强脑科技(BrainCo)合作,在便携式EEG设备上实现了视觉信号解析
- 神经反馈训练:基于脑信号的实时反馈,帮助焦虑症患者调节情绪
- 梦境还原:从脑信号重建视觉体验,目前已有初步实验结果
7.3 远景:与安宁疗护愿景的交汇
Brainμ代表的"AI+神经科学"方向,在临终关怀场景中可能会产生这些应用:
| 场景 | 需求 | Brainμ赋能方案 |
|---|---|---|
| 疼痛评估 | 晚期病人无法清晰表达疼痛程度 | 实时脑信号解码,客观量化疼痛等级 |
| 意识状态监测 | 判断临终患者是否有意识、是否能感知环境 | 从脑信号中提取意识相关活动特征 |
| 情绪识别 | 无法言语交流的患者情感状态判断 | 通过脑信号识别舒适/痛苦/安宁等情绪状态 |
| 回忆与陪伴 | 帮助患者回顾生命中的重要记忆 | 从脑信号中识别与特定记忆相关的神经活动模式 |
当然,上述场景目前仍在研究阶段,但作为技术趋势,它指向的是一个未来:AI不是取代人的关怀,而是让关怀更加精准。
八、总结
悟界·Brainμ 1.0的发布,可以看作AI发展的一个标志性事件。它验证了一个核心假设:
"预测下一个Token"这个统一的框架,不仅适用于人类制造的信息(文本、图像、视频),也适用于生命本身的信息(神经信号)。
这意味着什么?
往大了说:AI与生命科学的边界正在模糊——这两种曾经被认为完全不同的信息处理系统,可能在某种抽象的层面遵循相同的规律。
往小了说:对于所有从事AI、神经科学、心理学、Brainμ代表了"工具升级"的信号——在可预见的未来,"脑信号分析"会像"文本分析"一样便捷。
技术的演进从来不是线性的。有些年份平平无奇,有些年份埋下伏笔。2026年6月,Brainμ 1.0算是一个伏笔——给5-10年后的认知科学、心理健康、脑机接口、临终关怀,埋下了一颗种子。
更多推荐


所有评论(0)