Gemini 3 Deep Think 又贵又慢,究竟有啥用?
(注:本文为小报童精选文章。已订阅小报童或加入知识星球「玉树芝兰」用户请勿重复付费)
疑惑
你有没有遇到过这样的情况?
当你把一道复杂的数学题、一段报错的代码,或者一个需要严密逻辑推理的难题扔给 AI 时,它总是「秒回」。那一瞬间,你心里可能还会暗自赞叹:「哇,这速度真快!」可是当你满怀期待地仔细检查答案时,却发现里面漏洞百出。
因为大模型的底层是个文字接龙引擎,而不是个推理机器。所以如果你需要复杂问题的高水平答案,就不能只指望着它用思维系统 1 直出结果,而得靠着系统 2,也就是深度推理思考来处理。
这几年 AI 的推理能力在进步,确实,现在的 AI 比起两年前 GPT-4 时代,推理能力要强了很多。但代价是回答所需时间。从 OpenAI 的 o1 时代开始,稍微复杂一点的问题,基本上就是几分钟起步。到后来我使用 ChatGPT 5 Pro,等个 10 来分钟都是常事儿。
我停掉 ChatGPT Pro 订阅,并不是因为它的答案不够好,而是它的时效性实在是难以满足我的需求。那种感觉就像是你饿得前胸贴后背,点了一份外卖,结果骑手告诉你「您的订单正在精心制作,预计两小时后送达」。等它到的时候,你或许早就饿过劲儿了。
当我刚 看到 Google 发布 Gemini 3 Deep Think 模式的新闻时[1],说实话,我是非常无感的。
价格非常贵。目前只有 Google AI Ultra 订阅计划能用,而 Ultra 的月费嘛,每个月 250 美元。再加上之前被「慢思考」模式折磨的经历,我对这类产品天然就带着一种警惕。
不过,在 X 平台上,Gemini 3 Deep Think 模式还是收到了很多积极的评论。
看来这些评价,要说我这个科研工作者 / 工具折腾爱好者没有心动,那是假的。
于是,咬咬牙,咱也试用一个月。充一把冤大头又何妨?
一开始,我实际上没有什么靠谱方式,就是漫无边际地瞎试。我让它帮我研究比较严肃的问题,比如 Transformer 架构的模型什么时候会能力见顶。然后让它说明 Gemini 3 Deep Think 到底有什么用。我甚至还让它帮助我把「浪浪山小妖怪」化成 3D 模型。
实话实说,对于这些问题,Gemini 3 Deep Think 这玩意儿的真正用处不大,没有给我带来任何的惊喜。它答出来好像跟每月 20 美元的 Gemini 3 Pro 没有什么本质上的区别,四平八稳,无功无过。
收了这么多钱,你就…… 这点儿本事?
不过,事实很快证明,是我的用法不对。
转机
我周一下午写博客文章的时候,又写不下去了。
这篇文章基于我 12 月 5 号在南开大学的讲座。主持人李颖老师提了一个好问题,当时时间紧没能展开,我 6 号就试图把这个问题的答案系统全面整理出来。我沿着当时讲座的时候回答的思路来写,让 Dessix (得斯空间)帮我找出相关的学术文献作为印证补充。我越写越觉得,内容着实是充实而丰富了,但实在是改不下去。因为读起来虽然有道理,但是着实没啥新意,甚至越改越往陈词滥调上面狂奔。
我所面对的,不是一个平时教程中尝试解决的「如何去做」的问题;而是一项大家都在热议的新技术,在研究领域里适用性和边界的思辨。这种文章,逻辑稍微有一点瑕疵,就会被专业读者抓住把柄,贻笑大方。
抱着「死马当活马医」的心态,我把写到一半的文稿扔给了 Gemini 3 Deep Think,让它帮我看看问题出在哪里。
结果,它几乎是立刻就指出了一个致命伤。文章里有一个核心的逻辑混淆:我不能因为 AI 在「数据生成」环节不可靠,就否定它作为「研究方法」的合理性。因为「研究方法」还包括「数据分析」这个环节,而 AI 在数据分析上是完全可以胜任的。
虽然我在讲座回答中也说明了这一点,但可能偏重了有人误用 AI 作为数据收集来源的显著问题。这就导致了论证上偏颇。
Gemini 3 Deep Think 给出的诊断非常清晰,一共指出了三个明显的逻辑瑕疵。
第一个是定义层面的混淆,把「AI 不能做被试」的缺陷,错误地否定了「AI 作为研究方法」的合法性;第二是归因不够彻底,它指出 AI 不靠谱的根本原因是其「概率性」,也就是不具备确定性、不可复现,而不能坍缩为我文章里写的简单的「讨好」或者「童年阴影」之类的比喻;第三个是论据力度的缺失,它建议我应该引入 2024 年刊登在《Nature》上的重磅研究所提出的「模型崩溃」(Model Collapse)理论,以有力论证 AI 数据训练 AI 会导致模型退化和现实扭曲,这比单纯说「不规范」更具说服力。
这还不算,它干脆给出了修改后的文章全文。
之前文稿当中,我利用大模型帮我找到的那些相关文献支撑的链接,都得到了很好的保留。
然后它用「红绿灯」的方式给出了非常清晰的边界,说明哪些是可以做的,哪些是不可以做的。
最后的反思也是言简意赅,保留了我原先在讲座当中指出的意思。还把它升华了,提出了 AI 作为「元工具」的概念。
看到这个输出的时候,我是有点震惊的。这些意见,真正切中了我文章的要害。它像一个严格但公正的老师,不是简单地告诉你「这里不对」,而是告诉你「为什么不对」,以及手把手教你「应该怎么改」。
不过,它给出来的这个新版文章虽然清晰明快,但没有保留我的写作风格。我把修改版拷贝回了 Dessix,然后让 Dessix 以我之前的文章作为背景材料,换用我的风格再次输出。
你看,这里生成的结果,立即就图文并茂了。
引用、加黑、加粗、保持链接,都做得非常完美。
我当然不会直接把这样的结果呈现给读者。所谓文责自负,这里就体现出来了。之前我让 Dessix 帮我查找论述证据,现在我得验证这些证据(主要是参考文献)的真实性。
我一一点击这些文献资料原始链接,并且把它存到了 Youmind 里面。然后我还专门编写了一个 Youmind 快捷方式「事实核查」。只要用户把相应的引用结合文章 pdf 作为上下文输入,这个快捷方式就会调用 AI agent,判定这里的引述是否恰当。甚至它还进一步去 pdf 找支撑原文片段所在位置,给出译文。这样做的目的,当然是为了避免它幻觉出一篇文章虚拟的引用。
上图例子中,Youmind 判定我的引用是正确的,并且详细给出原文、译文和位置出处。
我这个手工验证过程怎么样?认真不?细致不?
当然,除了文献引用的核查,我也对整体文字手工进行了调整与润色。原始文稿描述从 AI 采集主观意见数据,因为是「无中生有」,所以 Gemini 使用了「造物主」这样的词汇,我觉得有些太过狂傲,所以把它改成了「永动机」这样更为贴切的表述。
整体工作都做完以后,我觉得文稿已经非常靠谱了。按照我以往的习惯,这个时候就应该准备发布了。但是我觉得「买了不用就是亏本」,所以再次找到 Gemini 3 Deep Think,帮助我做一下责任编辑,从中找一找是否还存在瑕疵。
检验
这个提示词没有任何复杂的,我直接贴在这儿:
我原本以为 Gemini 3 Deep Think 会给我找出一些错别字,纠正一些日期时间之类的问题。但结果却与我的构想大相径庭。
更多推荐



所有评论(0)