关键转折:让大模型来当大脑——V6类脑认知系统
「当AI学会发脾气」—— 一个类脑认知系统的诞生记
7个版本迭代Python脚本,教会AI像人一样焦虑、兴奋、犯错和成长
📚 全系列文章:
- 如果把你扔进一个迷宫,你的大脑在干什么?
- 150行代码,AI迈出了第一步
- 聪明反被聪明误——当AI用上了最强算法
- 给AI装上"近视眼镜"——有限感知的魔力
- AI也会焦虑?——当代码学会了"发脾气"
- 记忆的艺术——为什么忘记比记住更重要
- 👉 四大AI模型同走一个迷宫——谁更"像人"?(本篇)
- 意识是什么?——从代码到哲学的终极追问
📌 核心比喻:想象你是一位老师,出了同一道数学题,让四个性格迥异的学生来做——一个写得简洁有力,一个写了三页草稿纸,一个直接交了白卷,还有一个迟到了。这道"数学题"就是我们的11×11迷宫,而这四个"学生"就是四大国产AI模型。
⏱️ 阅读时间:约20分钟
🎯 学习目标:
- 了解四大国产AI模型(DeepSeek、Qwen、GLM、Kimi)的特点和差异
- 理解Temperature参数如何影响AI的"性格"
- 掌握调用大模型API的核心方法(10行代码即可!)
- 学会根据场景选择合适的AI模型
📝 文章摘要
前六篇,我们从零开始搭建了一个类脑认知系统——从最简单的随机游走,到BFS寻路,到有限感知,到情绪系统,再到记忆管理。AI的"大脑"一步步进化,越来越像人。
但有一个关键问题我们一直没回答:AI的"大脑"到底用的是什么?
答案是:大语言模型(LLM)。就像人类的大脑有不同的"型号"——有人擅长逻辑推理,有人擅长创意联想,有人反应极快但容易犯错——AI的"大脑"也有不同的"品牌"和"型号"。
这一篇,我们做了一个有趣的实验:让四个不同的AI模型走同一个迷宫,看看谁走得最好、谁最像人、谁会"发呆"。
结果非常有意思:
- 🧊 DeepSeek:像个效率至上的理科生,简洁有力,直奔主题
- 🔥 Qwen:像个文科学霸,推理链最长,连"路径势能"这种词都能说出来
- 💤 GLM:偶尔"发呆"——直接交白卷,API兼容性踩了坑
- 🚗 Kimi:那个"还在路上"的选手,潜力待开发
更关键的是,我们还揭秘了一个控制AI"性格"的神秘参数——Temperature。它就像一个"情绪旋钮",转低了AI变成死板学者,转高了AI变成天马行空的艺术家。而我们的情绪系统,正在自动调这个旋钮!
🎯 你需要先了解
📖 前置阅读:第6篇:记忆的艺术——为什么忘记比记住更重要
你需要了解:
- V3架构中AI如何通过LLM进行推理和决策
- 情绪系统如何影响AI的行为(焦虑、兴奋等)
- 记忆模块如何帮助AI学习和成长
- 什么是Prompt(提示词),AI怎么根据Prompt做决策
📖 正文
一、四个学生做同一道题——谁更聪明? 🎓
期末考试,老师出了一道题:
“从教学楼大门走到图书馆,中间有三道围墙挡着,请找到一条路。”
四个学生拿到了完全一样的题目和完全一样的地图。然后——
👤 学生A(DeepSeek):看了看题,刷刷写完,卷面干净整洁,5行搞定。
👤 学生B(Qwen):写了三页草稿纸,从地形分析到战略规划,连"这次迂回是积蓄路径势能的必要策略"都写上了。
👤 学生C(GLM):盯着卷子看了半天…交了白卷。😅
👤 学生D(Kimi):迟到了,还没到考场。🚗
你觉得谁更聪明?
这不是在讲笑话——这是我们真实实验的结果。同一个迷宫、同一段代码、同一条Prompt,只是换了不同的AI"大脑",结果天差地别。
🤔 为什么同一道题,不同AI答得如此不同?
这就像问:为什么同一道高考数学题,有人解法精炼,有人过程详尽,有人完全不会?
因为每个AI模型的"训练经历"不同,就像每个学生的"学习背景"不同。它们虽然都是基于Transformer架构的大语言模型,但训练数据、模型参数、对齐方式(RLHF)等等都不一样——这些差异造就了完全不同的"性格"。
二、实验设计——公平竞赛的规则 🔬
做对比实验,最重要的是什么?控制变量。
还记得中学物理课上的"控制变量法"吗?要比较四个灯泡的亮度,你得保证电压、电路、测量方式都一样,只有灯泡不同。
我们的实验设计也是这个思路:
🔒 控制不变的量:
- ✅ 同一个11×11迷宫(三道S型横墙)
- ✅ 同一套代码(V3认知架构)
- ✅ 同一条System Prompt
- ✅ 同一个Temperature设置(0.7)
- ✅ 同一个评估标准(前16步的表现)
🔄 唯一改变的量:
- AI的"大脑"——即LLM提供方(DeepSeek / Qwen / GLM / Kimi)
四大选手介绍
| 🏷️ 模型 | 🏢 厂商 | 🌐 API端点 | ⭐ 特点 |
|---|---|---|---|
| GLM-4.7-Flash | 智谱AI | open.bigmodel.cn | 速度极快,免费额度大 |
| DeepSeek-Chat | 深度求索 | api.deepseek.com | 推理能力强,支持JSON Mode |
| Moonshot-v1-8k | 月之暗面(Kimi) | api.moonshot.cn | 长上下文支持好 |
| Qwen-Plus | 阿里通义 | dashscope.aliyuncs.com | 推理详细,支持JSON Mode |
统一接口的秘密
这四个模型来自不同公司、不同API地址,但它们都有一个共同点:全部兼容OpenAI的API格式。
这意味着什么?意味着我们可以用同一套代码调用所有模型,只需要换一个参数:
from llm_client import LLMClient
# 只需要改这一个参数,就能切换不同的AI"大脑"!
client_ds = LLMClient(provider="deepseek") # DeepSeek大脑
client_qw = LLMClient(provider="qwen") # Qwen大脑
client_glm = LLMClient(provider="glm") # GLM大脑
client_kimi = LLMClient(provider="kimi") # Kimi大脑
# 调用方式完全一样
reply = client_ds.chat(
system_prompt="你是一个迷宫探索AI...",
user_prompt="当前位置(3,1),请决定下一步方向",
temperature=0.7
)
看到了吗?换大脑只需要改一个字符串。 这就像给同一台电脑换不同品牌的CPU——接口是标准化的,性能各有千秋。
我们在 llm_client.py 中实现了这个统一接口:
# llm_client.py 核心配置
LLM_CONFIGS = {
"glm": {
"api_key_env": "GLM_API_KEY",
"base_url": "https://open.bigmodel.cn/api/paas/v4/",
"model": "glm-4.7-flash",
},
"deepseek": {
"api_key_env": "OPENAI_API_KEY",
"base_url": "https://api.deepseek.com",
"model": "deepseek-chat",
},
"kimi": {
"api_key_env": "KIMI_API_KEY",
"base_url": "https://api.moonshot.cn/v1",
"model": "moonshot-v1-8k",
},
"qwen": {
"api_key_env": "QWEN_API_KEY",
"base_url": "https://dashscope.aliyuncs.com/compatible-mode/v1",
"model": "qwen-plus",
},
}
💡 为什么能用同一套代码?
因为国内主流大模型都选择了兼容OpenAI的API标准。这就像所有手机充电器都用Type-C接口一样——虽然内部芯片不同,但接口统一,用户就不用为每个品牌买一根不同的线。
在代码层面,我们用的是OpenAI官方Python SDK(openai库),只是把base_url指向了不同厂商的服务器。一套代码,四个大脑,即插即用。
三、结果大揭秘——三种AI的"性格" 🎭
实验跑完了,让我们来看看结果。(注:Kimi因API调试原因未参与本轮完整测试,我们主要对比DeepSeek、Qwen和GLM三位选手。)

📊 前16步表现对比
| 指标 | 🧊 DeepSeek | 💤 GLM-4 | 🔥 Qwen-Plus |
|---|---|---|---|
| 前5步完成 | ✅ 完整输出 | ❌ 无输出 | ✅ 完整输出 |
| 推理深度 | 中等详尽 | 失败 | 最详细 |
| 情绪描述 | 基础 | N/A | 详细+类人 |
| 16步位置 | (5,0) | 卡壳 | (5,0) |
| Token效率 | 较低 | N/A | 最高 |
🧊 DeepSeek:效率型理科生
DeepSeek的推理风格就像一个做题很快的理科生——看到题目,脑子里迅速过一遍,然后写下最精炼的答案。
它的第8步推理是这样的:
“我现在在(3,1),下方是墙,上方和左边已经探索过,右边是未探索区域。为了接近目标(10,10),我应该优先向右探索。”
简洁、清晰、直奔主题。没有废话,没有花里胡哨的修辞。5行字,决策完毕。
优点:省token、快速、准确
缺点:推理过程不够"透明",你很难知道它到底想了什么
🔥 Qwen-Plus:思考型文科学霸
Qwen的推理风格则完全不同——它像一个喜欢写长文分析的文科生,恨不得把每一步的心路历程都记录下来。
同样是第8步,Qwen是这样说的:
“我正站在y=1这一行,头顶就是y=2那排连续的横墙(从x=2到x=5),没法往上走;下方是墙,不能下;左边还没走过,右边虽可通行但已多次访问…我将此解释为迂回是积蓄路径势能的必要策略。”
看到那个词了吗——“路径势能”!这是一个物理学术语,Qwen竟然自己创造性地把它用在了迷宫导航中。这说明什么?说明Qwen的推理链更长、联想更丰富、表达更"像人"。

优点:推理透明、表述丰富、情绪描述类人
缺点:用的token多(虽然单步token高,但总效率反而不错)
你能感受到两者的差异吗?打个比方:
- DeepSeek像一个出租车司机——“左转,直行,到了。” 你坐在后面完全不知道为什么走这条路,但确实到了。
- Qwen像一个导游朋友——“我们现在在解放路上,前面那个路口红绿灯太长了,走右边这条小巷可以绕过去,而且这条巷子有家特好吃的包子铺…” 你不仅到了,还了解了为什么走这条路。
在类脑系统中,我们其实更想要Qwen这种风格——因为推理过程的透明性对于情绪模块和记忆模块来说非常重要。情绪系统需要"读懂"AI的推理,才能判断它是否焦虑或兴奋;记忆系统需要"理解"AI的决策逻辑,才能有效存储和检索经验。
🎯 一个有趣的发现
虽然Qwen每步用的token比DeepSeek多(推理文本更长),但Qwen的总步数更少!这意味着Qwen"想得多但走得准"——它花更多时间思考,但做出的决策更好,反而减少了总的探索步数。
这就像考试时:A同学每道题花1分钟,但做错了很多需要返工;B同学每道题花3分钟,但基本一遍过。最终B同学可能反而更快交卷。
💤 GLM-4-Flash:偶尔"发呆"的快枪手
GLM的情况比较特殊。它的速度确实很快(Flash版本,名副其实),但在我们的实验中遇到了一个尴尬的问题:LLM Response完全为空。
也就是说,GLM直接"交白卷"了。
这是什么原因呢?经过排查,我们发现主要有两个可能:
⚠️ GLM "沉默"故障分析
-
输出格式不兼容:我们的Prompt要求AI返回特定的JSON格式,但GLM的JSON Mode不是通过API参数控制的(不支持
response_format),而是需要在Prompt中强制要求。如果Prompt的格式要求不够明确,GLM可能输出了非JSON格式,被解析器判定为"空输出"。 -
API速率限制:GLM的免费模型有严格的调用频率限制(每秒/每分钟请求数)。在连续16步的快速调用中,可能触发了限流,导致返回为空。
解决方案:在System Prompt中更明确地要求JSON格式 + 增加调用间隔 + 添加重试逻辑。
这其实是一个非常真实的工程问题——理论上能用和实际上好用,中间隔着无数个坑。 每个AI模型都有自己的"脾气",你得去适配它。
说到这个,分享一个真实的调试故事:
我在第一次跑GLM模型的时候,日志文件里出现了大量的 LLM Response: (empty) 记录。一开始以为是网络问题,加了重试——不行。以为是API Key失效了,重新生成——还是不行。最后仔细对比了GLM和DeepSeek的API文档才发现:GLM不支持 response_format 参数!
我们的代码里有这么一段逻辑:
# JSON Mode 支持
if json_mode:
if self.provider in ("deepseek", "qwen"):
kwargs["response_format"] = {"type": "json_object"}
# GLM 和 Kimi 不支持这个参数
# 需要在 prompt 中用文字说明要求JSON格式
看到了吗?同样是"返回JSON",DeepSeek和Qwen可以通过API参数来保证,而GLM和Kimi只能靠"在Prompt里反复强调请输出JSON"。这就像——
- DeepSeek/Qwen:你直接设置了打印机的纸张大小为A4,打出来肯定是A4。
- GLM/Kimi:你在文件里写了一行"请用A4纸打印",但打印机可能忽略这行字…
工程经验:不同模型的API兼容程度不同,统一接口是第一步,但每个模型的"个性化适配"同样重要。
🎭 三种风格的本质差异
总结一下三个AI的"性格画像":
| 维度 | 🧊 DeepSeek | 🔥 Qwen | 💤 GLM |
|---|---|---|---|
| 做题风格 | 简答题高手 | 论述题高手 | 偶尔缺考 |
| 推理链长度 | 3-5句 | 8-12句 | N/A |
| 独创表述 | 很少 | 很多(“路径势能”) | N/A |
| 情绪表达 | “我应该向右” | “我感到这是最优策略” | 沉默 |
| 最像的人 | 理工科直男 | 文艺分析师 | 发呆的天才 |
一个有趣的思考:在"类人"这个维度上,Qwen的表现最接近人类。 因为人类在走迷宫时,脑子里的"内心独白"确实更像Qwen那种——会分析周围环境、会感叹、会给自己的行为找理由("迂回是积蓄路径势能"这种自我安慰式的推理,人类可太熟悉了 😂)。
四、Temperature参数的秘密——AI的"情绪旋钮" 🎛️
在分析完三个AI的"性格"之后,我们来聊一个更深层的问题:你能不能主动改变AI的"性格"?
答案是:可以! 而且只需要调一个参数——Temperature。
Temperature是什么?
还记得上学时考试的心态吗?
- 😤 特别紧张的时候:你会死死盯着课本上的标准答案,一字不差地背下来。写出来的答案很"安全",但也很"无聊"。
- 😊 心态放松的时候:你会发挥得更好,写出一些有创意的答案,甚至给出课本上没有的解法。
- 🤪 太放松了的时候:你开始天马行空,答案虽然有创意,但可能跑题了…
Temperature参数就是控制AI"紧张程度"的旋钮:
| Temperature | 类比 | 效果 |
|---|---|---|
| 0.1 | 😤 死记硬背的学者 | 每次都选概率最高的答案,精确但无创新 |
| 0.7 | 😊 平衡的正常人 | 主选最优,偶有变化,大多数场景最佳 |
| 0.9 | 🤪 天马行空的艺术家 | 选择更分散,有趣但可能跑偏 |

用代码说话
# Temperature = 0.1 → 每次都选"右"(最优方向)
reply_low = client.chat(system_prompt, user_prompt, temperature=0.1)
# 结果: "向右移动" "向右移动" "向右移动" (每次一样)
# Temperature = 0.7 → 大多选"右",偶尔选"上"
reply_mid = client.chat(system_prompt, user_prompt, temperature=0.7)
# 结果: "向右移动" "向右移动" "向上移动" (偶有变化)
# Temperature = 0.9 → 选择更分散
reply_high = client.chat(system_prompt, user_prompt, temperature=0.9)
# 结果: "向左移动" "向右移动" "向上移动" (更多探索)
🧠 Temperature的数学本质
在LLM内部,对每个可能的输出token,模型会计算一个"分数"(logits)。Temperature就是在softmax函数中对这些分数进行缩放:
P(token) = softmax(logits / temperature)
- Temperature↓ → 分数差异被放大 → 最高分的token独占概率 → 输出确定性高
- Temperature↑ → 分数差异被缩小 → 各token概率趋于均匀 → 输出随机性高
你不需要理解数学细节,只需要记住:Temperature越低越"死板",越高越"随性"。
情绪系统 × Temperature = 动态性格
还记得第5篇里我们给AI装的"情绪系统"吗?它的一个核心作用就是动态调节Temperature:
- 😰 AI很焦虑(连续碰壁、陷入死胡同)→ 降低Temperature → 更保守、更依赖已知路线
- 😃 AI很兴奋(发现新区域、接近目标)→ 适度提高Temperature → 更愿意探索、尝试新路线
这和人类的行为多像啊!你迷路时会紧张,紧张时会更倾向于走“确定安全”的路;而心情好的时候,你更愿意“冒个险”看看那条没走过的小巷通向哪里。
再举个例子:你去一个陌生城市旅游。
- 刚下飞机、拖着行李、累得要命的时候(焦虑高、Temperature低):你会乖乖跟着导航走,一步都不敢偏离。
- 第二天睡饱了、精神充沛、心情大好的时候(兴奋高、Temperature适中偏高):你会关掉导航,“随便走走看看,迷路也是乐趣!”
我们的AI不是用一个固定的Temperature,而是让情绪系统像人类一样,根据状态动态调整——这就是“类脑”设计的精髓。
五、手把手教你调用大模型API 🔧
看到这里,你是不是也想试试自己调用AI?别急,我来教你。
API是什么?像给AI打电话
API(Application Programming Interface)就像一个电话号码。你拨打这个号码(发送请求),AI那边接听(处理请求),然后给你回复。
- 📞 电话号码 = API端点(URL)
- 🔑 来电显示 = API Key(身份验证)
- 🗣️ 你说的话 = Prompt(输入)
- 📱 对方的回答 = Response(输出)
10行核心代码
调用大模型API其实只需要10行代码:
from openai import OpenAI
# 1. 创建客户端(以Qwen为例)
client = OpenAI(
api_key="你的API Key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
# 2. 发送对话请求
response = client.chat.completions.create(
model="qwen-plus",
messages=[
{"role": "system", "content": "你是一个迷宫导航AI"},
{"role": "user", "content": "我在(3,1),目标是(10,10),往哪走?"}
],
temperature=0.7
)
# 3. 获取回复
print(response.choices[0].message.content)
就这么简单!三步:创建客户端 → 发送请求 → 获取回复。
注意看 messages 参数的结构:它是一个列表,每个元素是一条"消息"。role 分三种:
"system":系统提示词,告诉AI它是谁、应该怎么行为"user":用户输入,就是你的问题或指令"assistant":AI的回复(用于多轮对话时提供历史上下文)
在我们的迷宫系统中,system 消息告诉AI"你是一个迷宫导航AI",user 消息则描述当前位置、周围环境、历史记忆等信息。AI基于这些信息做出决策。
API Key获取指南
🔑 各平台API Key获取方式
| 平台 | 注册地址 | 免费额度 |
|---|---|---|
| 智谱AI (GLM) | open.bigmodel.cn | 注册即送token |
| 深度求索 (DeepSeek) | platform.deepseek.com | 注册送额度 |
| 月之暗面 (Kimi) | platform.moonshot.cn | 注册送额度 |
| 阿里通义 (Qwen) | dashscope.console.aliyun.com | 免费模型可用 |
通用流程:注册账号 → 实名认证 → 创建API Key → 复制保存
⚠️ 安全提醒:API Key相当于你的"AI账号密码",千万不要上传到GitHub或分享给别人!建议存放在 .env 文件中,并将 .env 加入 .gitignore。
完整可运行示例
想在你的电脑上跑起来?跟着做:
# Step 1: 安装依赖
pip install openai python-dotenv
# Step 2: 创建 .env 文件
# 在项目根目录创建 .env,写入你的API Key:
# QWEN_API_KEY=sk-xxxxxxxxxxxxxxxx
# OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxx (DeepSeek用这个变量名)
# GLM_API_KEY=xxxxxxxxxxxxxxxx
# KIMI_API_KEY=sk-xxxxxxxxxxxxxxxx
# quick_test.py - 快速测试四大模型
import os
from dotenv import load_dotenv
from openai import OpenAI
load_dotenv()
# 测试配置
configs = {
"qwen": ("QWEN_API_KEY", "https://dashscope.aliyuncs.com/compatible-mode/v1", "qwen-plus"),
"deepseek": ("OPENAI_API_KEY", "https://api.deepseek.com", "deepseek-chat"),
"glm": ("GLM_API_KEY", "https://open.bigmodel.cn/api/paas/v4/", "glm-4.7-flash"),
}
question = "用一句话描述你自己的推理风格"
for name, (key_env, base_url, model) in configs.items():
api_key = os.getenv(key_env)
if not api_key:
print(f"⏭️ {name}: 未配置API Key,跳过")
continue
client = OpenAI(api_key=api_key, base_url=base_url)
try:
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": question}],
temperature=0.7, max_tokens=100
)
print(f"✅ {name}: {resp.choices[0].message.content.strip()}")
except Exception as e:
print(f"❌ {name}: {e}")
六、选择建议——新手该从哪个模型开始? 🧭
这么多模型,到底选哪个?这取决于你的场景和需求。
Token效率对比
先看一个硬核数据——我们的类脑系统在不同版本下的Token消耗:
| 版本 | 总步数 | 总Token | 平均Token/步 | 说明 |
|---|---|---|---|---|
| V1 | 98 | 12,321 | 125.7 | 简单prompt,步数多 |
| V3 | 50 | 10,623 | 212.5 | 认知架构,步数减半 |
| V7 | 42 | 42,074 | 1,001.5 | 完整推理链,质量最高 |
💰 Token与成本的关系
Token是AI计费的基本单位。粗略地说:
- 1个中文字 ≈ 1-2个token
- 1个英文单词 ≈ 1个token
- 1次API调用的费用 = 输入token数 × 输入单价 + 输出token数 × 输出单价
V7版本虽然每步token多(推理更详细),但总步数少(决策更准),最终效果最好。这就像买东西:便宜的可能要买三次(总花费反而高),贵的一次到位。
场景选择指南
| 你的需求 | 推荐模型 | 理由 |
|---|---|---|
| 🆓 预算为零,先玩玩 | GLM-4-Flash | 免费额度大,速度快 |
| 📝 需要结构化输出(JSON) | DeepSeek / Qwen | 原生支持 response_format |
| 🧠 需要深度推理 | Qwen-Plus | 推理链最长,表述最详细 |
| ⚡ 需要极速响应 | GLM-4-Flash | Flash版本,速度第一 |
| 📚 处理超长文本 | Kimi (moonshot-v1-8k) | 长上下文是强项 |
| 🏗️ 正式项目 | DeepSeek / Qwen | 稳定性好,JSON Mode可靠 |
推荐学习路径
🛤️ 新手推荐路径
第一步:Qwen入门
- 注册阿里云,获取免费API Key
- Qwen的文档最完善、社区最活跃
- 推理输出详细,方便debug和学习
第二步:DeepSeek进阶
- 推理能力强,JSON Mode稳定
- 性价比高,适合正式项目
- 社区热度高,遇到问题容易找到解决方案
第三步:多模型对比
- 用我们的
llm_client.py统一接口 - 同一个任务跑多个模型,找到最适合你场景的那个
- 不同任务可能适合不同模型——没有"最好",只有"最适合"
最终结论
AI模型的能力不是一维的"谁更强",而是多维度的均衡。
就像人一样——有人口才好,有人逻辑强,有人做事快。你不能说"口才好的人比逻辑强的人更聪明",因为他们各有所长。
选AI也是一样:
- 要速度选GLM
- 要深度选Qwen
- 要稳定选DeepSeek
- 要长文选Kimi
最聪明的做法不是找到"最好的模型",而是学会在不同场景下选择"最合适的模型"。
🔍 补充:JSON Mode的重要性
为什么我们一直强调JSON Mode?因为在类脑系统中,AI的回复不是给人看的——是给代码解析的。
如果AI返回:“我觉得应该向右走,因为右边有未探索区域”——这是自然语言,代码很难从中提取出"right"这个方向指令。
但如果AI返回:{"action": "right", "reasoning": "右边有未探索区域"}——代码可以直接 json.loads() 解析,干净利落。
这就是为什么DeepSeek和Qwen在我们的系统中表现更好——它们原生支持JSON Mode,输出格式稳定可靠。而GLM的稳定性在这方面就差了一截。
⚠️ 常见误区
❌ 误区1:Temperature越高越好 / 越低越好
Temperature没有"最好的值"。太低了AI变成复读机,太高了AI变成疯子。对于大多数任务,0.7是一个很好的起点。需要精确输出(如JSON、代码)时调低,需要创意(如写故事、头脑风暴)时调高。
❌ 误区2:贵的模型一定比便宜的好
不一定!在我们的迷宫实验中,免费的GLM虽然遇到了兼容性问题,但在其他任务上表现可能很出色。选模型要看具体任务,而不是价格。
❌ 误区3:一个模型搞定所有事
每个模型都有长短板。实际项目中,很多团队会混合使用多个模型:简单任务用便宜快速的模型,复杂推理用高端模型。这叫"模型路由"策略。
❌ 误区4:API调用很复杂需要学很久
如你所见,核心代码只有10行!安装openai库、配置API Key、发送请求——半小时就能跑通。不要被"人工智能"这四个字吓到。
❌ 误区5:AI的输出是确定的
因为Temperature的存在,即使输入完全相同,AI的输出也可能不同(Temperature > 0时)。这不是bug,是feature——这种随机性正是AI"创造力"的来源。
💡 一句话总结:同一个迷宫,不同AI走出了完全不同的风格——选AI不是选"最强",而是选"最合适"。Temperature是AI的"情绪旋钮",而我们的情绪系统正在自动调它。
✍️ 课后思考
-
模型混合策略:如果你在做一个项目,简单的意图识别用GLM(快+便宜),复杂的推理用Qwen(深+准),你会怎么设计这个"路由"逻辑?什么样的请求算"简单",什么样的算"复杂"?
-
Temperature的自适应:除了我们的情绪系统,你还能想到什么方式来动态调节Temperature吗?比如,根据任务的"重要程度"?根据AI"连续正确"的次数?
-
GLM的"沉默"修复:如果你来修复GLM交白卷的问题,你会怎么做?提示:想想Prompt设计、重试机制、输出格式校验这三个方向。
-
Token效率vs决策质量:V1每步125 token但走了98步,V7每步1001 token但只走了42步。如果你是产品经理,预算有限,你会选择哪个方案?为什么?(提示:不只是看总 token数,还要考虑用户体验和结果质量。想想看,用户是希望看到AI走了98步终于到达,还是42步干净利落地到达?)
-
自己动手试试:用本文提供的代码示例,申请一个免费API Key,试着调用一下大模型。问它一个你感兴趣的问题,然后分别用Temperature=0.1和0.9各问一次,对比回答有什么不同。你可能会惊讶于同一个AI在不同Temperature下的巨大差异——这正是本文想让你体验的核心之一。
📚 术语表
| 术语 | 说明 |
|---|---|
| LLM (Large Language Model) | 大语言模型,AI的"大脑"核心 |
| Temperature | 控制AI输出随机性的参数,越低越确定 |
| Token | AI处理文本的基本单位,粗略等于1-2个字 |
| API (Application Programming Interface) | 程序之间通信的接口 |
| JSON Mode | 强制AI输出JSON格式的模式 |
| Prompt | 给AI的提示词/指令 |
| response_format | API参数,控制输出格式 |
| RLHF | 基于人类反馈的强化学习,用于对齐模型行为 |
| Softmax | 将分数转换为概率分布的函数 |
| Logits | 模型输出的原始分数(softmax之前) |
📝 下一篇预告
第8篇:意识是什么?——从代码到哲学的终极追问
七篇文章,我们从随机游走一路进化到了带有情绪、记忆、推理能力的类脑AI系统。它会焦虑、会兴奋、会犯错、会成长。
但这一切,算是"意识"吗?
当一个AI说"我很焦虑"的时候,它真的在焦虑吗?还是只是在模拟焦虑的文字输出?当它说"我决定向右走"的时候,它真的在"决定"吗?还是只是在执行一个概率最高的token序列?
下一篇——也是本系列的终章——我们将从代码走向哲学,探讨人工智能领域最深刻的问题:什么是意识?我们的代码离"真正的智能"还有多远?
从if-else到LLM,从随机游走到类脑认知——这趟旅程的终点,也是新旅程的起点。
👨💻 作者简介:NeuroConscious Research Team,一群热爱 AI 科普的研究者,专注于神经科学启发的 AI架构设计与可解释性研究。理念:“再复杂的概念,也能用大白话讲清楚”。
首席科学家:WENG YONGGANG 翁勇刚 马来西亚理工大学工商管理博士
💻 项目地址:https://github.com/wyg5208/nct.git
🌐 官网地址:https://neuroconscious.link
📝 作者 CSDN:https://blog.csdn.net/yweng18
📦 NCT PyPI:https://pypi.org/project/neuroconscious-transformer/
⭐ 欢迎 Star⭐、Fork🍴、贡献代码🤝
📝 「当AI学会发脾气」系列 | 第7篇 · 四大AI模型同走一个迷宫——谁更"像人"?
作者:一个喜欢让AI互相比赛的工程师
🔗 上一篇:记忆的艺术 | 下一篇:意识是什么?
如果这篇文章帮你搞懂了怎么选AI模型,请分享给你的朋友 🧠
更多推荐


所有评论(0)