最近我看到一篇论文DeepSeek团队的最新论文《Conditional Memory via Scalable Lookup》,第一反应是:

如果这个东西被用进 DeepSeek,
那它真的会“质变”。

不是比别人多算点题,
而是——学会了“直接查答案”。

很多人以为,大模型变强,只有一条路:参数更多、算力更猛、烧钱更狠。而这一次,不是参数,不是算力,而是记忆。


1、现在的大模型有多笨?

现在的大模型是——

全世界最聪明的“现算型选手”

  • 不会背书

  • 不会速查

  • 不会条件反射

所有问题,一律现场推理。

哪怕是最基础的常识,
它每次都要:

注意力 → 前馈神经网络 → 注意力 → 前馈神经网络
一层一层“算”出来

这就像什么?

    一个人,每次想起自己生日,都要从身份证号重新推导一遍。

荒不荒谬?

这导致:1.算力被浪费在本不该算的东西上;2.真正需要逻辑的地方,算力反而不够;3.成本极高,与效率不成比例

而我们人类是怎么思考的?

  • 看到“牛顿三定律”
    → 不是现场推导一遍力学
    → 而是直接“想起来”

  • 看到“北京是中国首都”
    → 不是逻辑推理
    → 是条件反射式记忆

大模型和人类大脑思考方式还差一个“记忆”。


2、这次DeepSeek团队的新突破

给模型一块「静态记忆区」

论文里提出了一个概念,叫 Conditional Memory(条件记忆)

图片

你可以把它理解成:

模型内部的“高速知识缓存”。

它专门干三件事:

    存:固定模式、常识、短语、结构

    查:O(1) 时间,几乎不耗算力

    融合:只在“需要的时候”才启用

    也就是说——不是所有问题都查记忆,但能查的,绝不再算。

    当以后再遇到常识性问题、固定搭配等时,DeepSeek不再进行计算,而是翻开记忆,直接给出答案。


    3、这对 DeepSeek 意味着什么?

    注意,DeepSeek 本身就有三个特性:

    • 极强的工程优化能力

    • 极致性价比

    • 不迷信“参数碾压”

    而这套思路,本质上就是一句话:

    让模型更聪明地用资源,而不是更多资源。

    如果 DeepSeek 引入类似机制,会发生什么?

    同样算力 → 更强能力

    同样能力 → 更低成本

    长上下文 → 不再靠硬撑

    甚至——

    模型“越用越像有长期记忆”。


    4、真正的爆点

    论文里有一个非常炸裂的发现:

    模型参数,在“计算”和“记忆”之间,
    存在一个 U 型最优分配。

    翻译成人话:

      全算 → 浪费

      全记 → 变死

      算 + 记 → 最强

      实验结果显示:

      把大约 20%–25% 的参数用来当“记忆”,整体性能反而更高。

      图片

      这意味着什么?

      未来的大模型,
      不再是“一个大脑”,
      而是:大脑 + 海马体。


      这不是“小改进”,而是路线变化。

      你要意识到一件事:MoE 解决的算谁的问题;长上下文解决的是看多远的问题。

      而这篇论文解决的是:“还要不要每次都想”的问题,这是认知结构级别的升级


      5、为什么DeepSeek 会因此更可怕?

      因为 DeepSeek 有一个核心气质:

      不追热点,但一旦选中路线,
      就往“工程极限”打。

      一旦他们认同这条路径:

      你看到的可能不是“更大模型”,而是:

        更稳的推理

        更低的延迟

        更接近“人类直觉”的回答


        6、“开源”比论文本身还重要

        DeepSeek又将此次研究开源在github官方仓库(https://github.com/deepseek-ai/Engram),开源会逼着整个行业“跟进”。

        AI 领域有一个规律:

        一旦某个机制被证明:
        性能↑、成本↓、可复现
        那不跟进的公司,反而要解释自己为什么不用。

        就像当年Attention、Transformer、MoE一开始都是论文,最后都变成了 “你不用你就落后”

        条件记忆,很可能正在走同一条路。

        如果你站在 2–3 年后回看,你可能会发现:2026 年大模型的分水岭,不是“谁的参数更大”,而是谁先把“记忆”和“思考”融合了。而这篇论文 + 开源代码,很可能是那条分界线的起点。

        现在,门已经被打开了一条缝。谁先走进去,谁就会看起来像突然变强了。


        参考资料:

        • github仓库:https://github.com/deepseek-ai/Engram

        • DeepSeek论文:https://arxiv.org/abs/2601.07372

        Logo

        Agent 垂直技术社区,欢迎活跃、内容共建。

        更多推荐