什么?DeepSeek又要变强了?
最近我看到一篇论文DeepSeek团队的最新论文《Conditional Memory via Scalable Lookup》,第一反应是:
如果这个东西被用进 DeepSeek,
那它真的会“质变”。
不是比别人多算点题,
而是——学会了“直接查答案”。
很多人以为,大模型变强,只有一条路:参数更多、算力更猛、烧钱更狠。而这一次,不是参数,不是算力,而是记忆。
1、现在的大模型有多笨?
现在的大模型是——
全世界最聪明的“现算型选手”
-
不会背书
-
不会速查
-
不会条件反射
所有问题,一律现场推理。
哪怕是最基础的常识,
它每次都要:
注意力 → 前馈神经网络 → 注意力 → 前馈神经网络
一层一层“算”出来
这就像什么?
一个人,每次想起自己生日,都要从身份证号重新推导一遍。
荒不荒谬?
这导致:1.算力被浪费在本不该算的东西上;2.真正需要逻辑的地方,算力反而不够;3.成本极高,与效率不成比例
而我们人类是怎么思考的?
-
看到“牛顿三定律”
→ 不是现场推导一遍力学
→ 而是直接“想起来” -
看到“北京是中国首都”
→ 不是逻辑推理
→ 是条件反射式记忆
大模型和人类大脑思考方式还差一个“记忆”。
2、这次DeepSeek团队的新突破
给模型一块「静态记忆区」
论文里提出了一个概念,叫 Conditional Memory(条件记忆)。

你可以把它理解成:
模型内部的“高速知识缓存”。
它专门干三件事:
存:固定模式、常识、短语、结构
查:O(1) 时间,几乎不耗算力
融合:只在“需要的时候”才启用
也就是说——不是所有问题都查记忆,但能查的,绝不再算。
当以后再遇到常识性问题、固定搭配等时,DeepSeek不再进行计算,而是翻开记忆,直接给出答案。
3、这对 DeepSeek 意味着什么?
注意,DeepSeek 本身就有三个特性:
-
极强的工程优化能力
-
极致性价比
-
不迷信“参数碾压”
而这套思路,本质上就是一句话:
让模型更聪明地用资源,而不是更多资源。
如果 DeepSeek 引入类似机制,会发生什么?
同样算力 → 更强能力
同样能力 → 更低成本
长上下文 → 不再靠硬撑
甚至——
模型“越用越像有长期记忆”。
4、真正的爆点
论文里有一个非常炸裂的发现:
模型参数,在“计算”和“记忆”之间,
存在一个 U 型最优分配。
翻译成人话:
全算 → 浪费
全记 → 变死
算 + 记 → 最强
实验结果显示:
把大约 20%–25% 的参数用来当“记忆”,整体性能反而更高。

这意味着什么?
未来的大模型,
不再是“一个大脑”,
而是:大脑 + 海马体。
这不是“小改进”,而是路线变化。
你要意识到一件事:MoE 解决的算谁的问题;长上下文解决的是看多远的问题。
而这篇论文解决的是:“还要不要每次都想”的问题,这是认知结构级别的升级。
5、为什么DeepSeek 会因此更可怕?
因为 DeepSeek 有一个核心气质:
不追热点,但一旦选中路线,
就往“工程极限”打。
一旦他们认同这条路径:
你看到的可能不是“更大模型”,而是:
更稳的推理
更低的延迟
更接近“人类直觉”的回答
6、“开源”比论文本身还重要
DeepSeek又将此次研究开源在github官方仓库(https://github.com/deepseek-ai/Engram),开源会逼着整个行业“跟进”。
AI 领域有一个规律:
一旦某个机制被证明:
性能↑、成本↓、可复现
那不跟进的公司,反而要解释自己为什么不用。
就像当年Attention、Transformer、MoE一开始都是论文,最后都变成了 “你不用你就落后”。
条件记忆,很可能正在走同一条路。
如果你站在 2–3 年后回看,你可能会发现:2026 年大模型的分水岭,不是“谁的参数更大”,而是谁先把“记忆”和“思考”融合了。而这篇论文 + 开源代码,很可能是那条分界线的起点。
现在,门已经被打开了一条缝。谁先走进去,谁就会看起来像突然变强了。
参考资料:
-
github仓库:https://github.com/deepseek-ai/Engram
-
DeepSeek论文:https://arxiv.org/abs/2601.07372
更多推荐



所有评论(0)