说真的,我是服了 DeepSeek 这帮人。

2025 年的最后一天,当大家都在忙着跨年、发朋友圈总结的时候,DeepSeek 默默在 ArXiv 上扔了一篇论文——mHC (Manifold-Constrained Hyper-Connections) 。

我也没想到,跨年夜不仅要陪家人,还得陪论文。但读完之后,我只有一个感觉:这帮人不仅卷,而且是真的敢动地基。

如果说之前的 MoE 是在装修上下功夫,那这次 mHC,他们是直接拿着铲子去挖 Transformer 的祖坟——残差连接(Residual Connection)

咱们今天不掉书袋,不搞那些晦涩的公式,就聊聊 DeepSeek 这次到底干了啥,以及为什么我觉得 V4 可能会是个狠角色。

1. 为什么要修“高速公路”?

大家都知道,现在的 LLM(大模型)之所以能堆得这么深,全靠 ResNet 当年的神来之笔:残差连接

简单说,就是给神经网络搭了一条“直通管道”,让信号能无损地传下去。要是没有它,模型层数一多,信号传着传着就没了,训练根本跑不起来。

但是,到了 2024 年,字节跳动的研究员们(Seed 团队)发现了一个问题:这条管道太窄了。

传统的残差连接就像一条单车道。虽然稳,但车流量(信息量)有限。于是字节搞了个 Hyper-Connections (HC),大笔一挥,把单车道扩建成了四车道、八车道的高速公路。不仅路宽了,还允许车在不同车道间变道(线性混合)。

听起来很完美对吧?

但这事坏就坏在“没交警”。

2. 车祸现场:Loss 原地起飞

原来的单车道虽然窄,但它有个数学上的“免死金牌”——恒等映射(Identity Mapping)。这玩意儿保证了不管你怎么跑,信号基本是守恒的。

一旦扩建成多车道(HC),各种乱七八糟的矩阵乘法一加进来,这块免死金牌就碎了。

DeepSeek 在论文里晒了一张图,简直就是“车祸现场”:用原始的 HC 方法训练,跑到 12k 步的时候,Loss 直接原地起飞,梯度像心电图一样乱跳。

原因很简单:信号在层层传递中失控了。这就好比你对着麦克风说话,回声不断叠加,最后音箱发出刺耳的啸叫——这就叫梯度爆炸。

3. DeepSeek 的解法:戴着镣铐跳舞

这时候,DeepSeek 的数学功底就显出来了。他们说:路要宽,但车速必须锁死。

他们搞出了这个 mHC(流形约束超连接)

听着名字很高大上,其实核心思想特别像物理里的“能量守恒”

DeepSeek 给这些扩宽的车道加了一把锁:强制要求所有的混合矩阵必须是“双随机矩阵”(Doubly Stochastic Matrix)。

这一步走得太妙了。

  • 啥叫双随机? 就是这个矩阵每一行加起来是 1,每一列加起来也是 1。

  • 有啥用? 这在几何上对应一个叫“Birkhoff 多面体”的东西(不用管它是啥,反正很稳)。这从数学上保证了,信号传过去,总量不会凭空变大,也不会莫名消失。

这就像是给高速公路装了一套极其精密的智能整流系统。不管你怎么变道,总流量被死死地按住了。

为了实现这个,他们用了经典的 Sinkhorn 算法,像洗衣服一样把参数矩阵反复“搓洗”(归一化),搓个 20 次,就老实了。

结果呢?那个“音箱啸叫”的问题彻底解决了。信号增益从原来的 3000 多(简直离谱),被摁回了 1.6 左右。稳如老狗。

4. 暴力美学:工程优化

如果光有数学理论,那只是教授们的玩具。DeepSeek 最可怕的地方在于,他们是一群会写底层 CUDA 代码的数学家

要把这套理论搬到几万张卡上跑,最大的拦路虎是显存通信。多车道意味着参数量和计算量的大增。

DeepSeek 又是怎么干的?

  1. 算子融合(Kernel Fusion): 把好几步操作揉进一个内核里算,减少显存读写次数。

  2. 动态重计算: 显存不够?那就用算力换空间。前向传播时扔掉中间结果,反向传播时再算一遍。

  3. DualPipe 重叠: 计算的时候偷偷做通信,别让 GPU 闲着。

最后一看账单:把这套复杂的 mHC 系统塞进 27B 的模型里,训练时间只增加了 **6.7%**。

用 6% 的时间成本,换来了模型容量的质变,这笔买卖太划算了。

5. 最后的彩蛋:V4 要来了?

看完这篇论文,我不负责任地猜一下:DeepSeek V4 真的在憋大招。

你看,他们先是搞定了 MoE(混合专家),现在又把最基础的残差连接给重构了。这说明他们不再满足于在 Transformer 的原有框架上修修补补,而是开始动底层架构了。

实验结果也证明了这点:27B 的 mHC 模型,在 BBH、GSM8K 这些硬核测试集上,全面超越了标准版模型。而且他们在 3B、9B 模型上都试过,这套方法是可以 Scale up 的。

总结一下:DeepSeek 这次是用最硬核的数学约束,解决了最狂野的模型扩张问题。

这种“甚至愿意为了改进 1% 的性能去重写底层算子”的劲头,才是国产大模型最稀缺的东西。

2026,有好戏看了。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐