DeepSeek 的新年炸弹:为了搞 V4,他们把 Transformer 的地基给撬了
说真的,我是服了 DeepSeek 这帮人。
2025 年的最后一天,当大家都在忙着跨年、发朋友圈总结的时候,DeepSeek 默默在 ArXiv 上扔了一篇论文——mHC (Manifold-Constrained Hyper-Connections) 。
我也没想到,跨年夜不仅要陪家人,还得陪论文。但读完之后,我只有一个感觉:这帮人不仅卷,而且是真的敢动地基。
如果说之前的 MoE 是在装修上下功夫,那这次 mHC,他们是直接拿着铲子去挖 Transformer 的祖坟——残差连接(Residual Connection)。
咱们今天不掉书袋,不搞那些晦涩的公式,就聊聊 DeepSeek 这次到底干了啥,以及为什么我觉得 V4 可能会是个狠角色。
1. 为什么要修“高速公路”?
大家都知道,现在的 LLM(大模型)之所以能堆得这么深,全靠 ResNet 当年的神来之笔:残差连接。
简单说,就是给神经网络搭了一条“直通管道”,让信号能无损地传下去。要是没有它,模型层数一多,信号传着传着就没了,训练根本跑不起来。
但是,到了 2024 年,字节跳动的研究员们(Seed 团队)发现了一个问题:这条管道太窄了。
传统的残差连接就像一条单车道。虽然稳,但车流量(信息量)有限。于是字节搞了个 Hyper-Connections (HC),大笔一挥,把单车道扩建成了四车道、八车道的高速公路。不仅路宽了,还允许车在不同车道间变道(线性混合)。
听起来很完美对吧?
但这事坏就坏在“没交警”。
2. 车祸现场:Loss 原地起飞
原来的单车道虽然窄,但它有个数学上的“免死金牌”——恒等映射(Identity Mapping)。这玩意儿保证了不管你怎么跑,信号基本是守恒的。
一旦扩建成多车道(HC),各种乱七八糟的矩阵乘法一加进来,这块免死金牌就碎了。
DeepSeek 在论文里晒了一张图,简直就是“车祸现场”:用原始的 HC 方法训练,跑到 12k 步的时候,Loss 直接原地起飞,梯度像心电图一样乱跳。
原因很简单:信号在层层传递中失控了。这就好比你对着麦克风说话,回声不断叠加,最后音箱发出刺耳的啸叫——这就叫梯度爆炸。
3. DeepSeek 的解法:戴着镣铐跳舞
这时候,DeepSeek 的数学功底就显出来了。他们说:路要宽,但车速必须锁死。
他们搞出了这个 mHC(流形约束超连接)。
听着名字很高大上,其实核心思想特别像物理里的“能量守恒”。
DeepSeek 给这些扩宽的车道加了一把锁:强制要求所有的混合矩阵必须是“双随机矩阵”(Doubly Stochastic Matrix)。
这一步走得太妙了。
-
啥叫双随机? 就是这个矩阵每一行加起来是 1,每一列加起来也是 1。
-
有啥用? 这在几何上对应一个叫“Birkhoff 多面体”的东西(不用管它是啥,反正很稳)。这从数学上保证了,信号传过去,总量不会凭空变大,也不会莫名消失。
这就像是给高速公路装了一套极其精密的智能整流系统。不管你怎么变道,总流量被死死地按住了。
为了实现这个,他们用了经典的 Sinkhorn 算法,像洗衣服一样把参数矩阵反复“搓洗”(归一化),搓个 20 次,就老实了。
结果呢?那个“音箱啸叫”的问题彻底解决了。信号增益从原来的 3000 多(简直离谱),被摁回了 1.6 左右。稳如老狗。
4. 暴力美学:工程优化
如果光有数学理论,那只是教授们的玩具。DeepSeek 最可怕的地方在于,他们是一群会写底层 CUDA 代码的数学家。
要把这套理论搬到几万张卡上跑,最大的拦路虎是显存和通信。多车道意味着参数量和计算量的大增。
DeepSeek 又是怎么干的?
-
算子融合(Kernel Fusion): 把好几步操作揉进一个内核里算,减少显存读写次数。
-
动态重计算: 显存不够?那就用算力换空间。前向传播时扔掉中间结果,反向传播时再算一遍。
-
DualPipe 重叠: 计算的时候偷偷做通信,别让 GPU 闲着。
最后一看账单:把这套复杂的 mHC 系统塞进 27B 的模型里,训练时间只增加了 **6.7%**。
用 6% 的时间成本,换来了模型容量的质变,这笔买卖太划算了。
5. 最后的彩蛋:V4 要来了?
看完这篇论文,我不负责任地猜一下:DeepSeek V4 真的在憋大招。
你看,他们先是搞定了 MoE(混合专家),现在又把最基础的残差连接给重构了。这说明他们不再满足于在 Transformer 的原有框架上修修补补,而是开始动底层架构了。
实验结果也证明了这点:27B 的 mHC 模型,在 BBH、GSM8K 这些硬核测试集上,全面超越了标准版模型。而且他们在 3B、9B 模型上都试过,这套方法是可以 Scale up 的。
总结一下:DeepSeek 这次是用最硬核的数学约束,解决了最狂野的模型扩张问题。
这种“甚至愿意为了改进 1% 的性能去重写底层算子”的劲头,才是国产大模型最稀缺的东西。
2026,有好戏看了。
更多推荐


所有评论(0)