AI Agent从无到有5: 大语言模型(LLM)的前世今生与全景扫描
纲要
- 大语言模型的定义与基础
LLM概念:基于深度学习的自然语言处理模型- 核心能力:文本生成、分类、摘要、翻译等
- 技术演进路线
- 词向量与
One‑Hot编码的局限 - 词嵌入:低维稠密向量与语义关系
RNN/LSTM:序列建模与长短期记忆Transformer:自注意力机制与预训练范式BERTvsGPT:微调与多任务统一- 多模态与推理模型
- 终极目标:人工通用智能(
AGI)
- 词向量与
- 当前主流
LLM格局- 国际模型:OpenAI o1/GPT‑4、Claude、Gemini、LLaMA
- 国内模型:豆包、文心、通义千问、DeepSeek、GLM
- 能力维度:推理、编码、数学、视觉、文生图
- 模型选择关键因素
- 闭源 vs 开源
- 上下文窗口大小
- 调用成本
- 任务匹配度
- 代码实战:调用大模型 API 的通用封装
- 使用 Python 同时调用 OpenAI 和 DeepSeek
- 比较回复质量与成本
- 总结与趋势
大语言模型:AI Agent 的超级大脑
随着 AI Agent 的兴起,几乎所有智能化应用都围绕着一个核心组件运转——大语言模型(Large Language Model,简称 LLM)。对于刚刚踏入这一领域的开发者而言,理解 LLM 是什么、它经历了怎样的发展、目前有哪些主流选择,是后续构建 Agent 不可或缺的理论基础。
LLM 是基于深度学习的自然语言处理模型,能够学习自然语言的语法和语义,并生成人类可读的文本。这类模型通常拥有数十亿到数万亿的参数,通过在互联网海量文本上进行训练,掌握了文本生成、分类、摘要、翻译、语音识别等多种能力。而这一切能力的源头,可以追溯到一项颠覆性的架构:Transformer。
从词向量到 Transformer:大模型的“前世今生”
要让计算机理解自然语言,第一步是将文字转换为数字。这一过程经历了多次迭代。
词向量与 One‑Hot 编码
最朴素的想法是“一个词一个位置”。例如,假设语料中只有“猫、狗、牛、羊”四个词,那么可以这样表示:
- 猫 →
[1, 0, 0, 0] - 狗 →
[0, 1, 0, 0] - 牛 →
[0, 0, 1, 0] - 羊 →
[0, 0, 0, 1]
这种 One‑Hot 编码虽然简单,但有两个致命缺陷:无法表达词与词之间的关系,且向量维度随词汇量线性膨胀,导致计算和存储效率极低。
词嵌入:让语义在空间中对齐
词嵌入(Word Embedding)将高维稀疏的 One‑Hot 向量映射到一个低维稠密的向量空间。在这个空间里,语义相近的词距离更近。例如,“牛”和“羊”同属家畜,其向量会彼此靠近;“猫”和“狗”同为宠物,也会聚成一簇。这种表示不仅维度大幅降低,还具备优秀的迁移学习能力,可以在不同自然语言任务中复用。
下面用一段简单的 Python 代码演示词嵌入的效果(使用 Gensim 加载预训练的 Glove 模型):
import gensim.downloader as api
# 加载小型 GloVe 词向量(首次运行会自动下载)
model = api.load("glove-wiki-gigaword-50")
# 查看词语向量
print("猫的向量(部分):", model["cat"][:10])
# 计算语义相似度
print("猫和狗的相似度:", model.similarity("cat", "dog"))
print("猫和汽车的相似度:", model.similarity("cat", "car"))
# 寻找与“国王”语义最接近的词(经典类比:国王 - 男人 + 女人 ≈ 王后)
result = model.most_similar(positive=["king", "woman"], negative=["man"], topn=1)
print("king - man + woman =", result[0][0])
运行这段代码,你会直观地看到词嵌入如何捕捉语义关系。
从 RNN 到 LSTM:处理序列信息
自然语言是典型的序列数据——单词的顺序直接影响含义。循环神经网络(RNN)专门为序列建模而设计,它按顺序处理每一个单词,并将前文信息传递给后续步骤。但普通 RNN 会遭遇短期记忆丢失和训练成本高的问题。
长短时记忆网络(LSTM)引入“记忆单元”和门控机制,能够选择性地记住重要信息、遗忘无关内容,从而在机器翻译、语音识别等任务中表现优异。不过,这两类模型仍然需要大量人工标注数据,且在并行计算方面效率低下。
Transformer 与预训练革命
2017 年,Google 提出 Transformer 架构,彻底改变了 NLP 的范式。其核心是自注意力机制,让模型在理解一个词时,能够同时关注句子中所有其他词,而不必像 RNN 那样顺序传递。这使得模型可以:
- 并行训练,大幅缩短训练时间;
- 捕捉长距离依赖,缓解遗忘问题;
- 采用自监督学习,在海量无标注文本上进行预训练,不再依赖昂贵的人工标注。
Transformer 就像一个“超级完形填空”机器:给定一段话并挖去一些词,它通过上下文预测被挖掉的内容,从而学会语言的深层规律。
在 Transformer 基础上,BERT 通过“掩码语言模型”进行预训练,然后为每个具体任务(如情感分析、问答)添加一个微调层。其缺点是一个任务一个模型,通用性较差。而 GPT 系列采用自回归生成方式,并逐步统一为“预训练 + 提示(Prompt)”范式,使得同一个模型可以完成写作、翻译、聊天等多种任务。
2022 年底 ChatGPT 的问世,标志着大模型真正走向通用化和实用化。下图简要概括了从词向量到现代 LLM 的发展主线:
多模态与推理模型:未来方向
当前最前沿的大模型已经突破纯文本的边界,进入多模态时代:能够同时理解文字、图像、声音甚至视频。这就像拥有一个全能助手,既能听懂你的口头指令,又能看懂你展示的图片,还能分析视频内容。在医疗诊断中,它可以同时分析病患症状描述和 X 光片;在教育领域,它能结合学生的口语提问和手写作业给出个性化指导。
此外,以 OpenAI o1 为代表的推理模型在回答问题前会进行“思考”——内部执行多步推理过程,从而在数学、编程等复杂任务上大幅超越传统模型。
这些技术的持续进化,最终指向一个宏大目标:人工通用智能(AGI)。AGI 不仅能完成特定任务,还能像人类一样思考、学习、推理,适应各种未知环境。尽管伦理和安全问题尚待解决,但大模型无疑是通往 AGI 的关键阶梯。
全景扫描:国内外主流大模型
当前大模型市场竞争激烈,模型数量几乎每天都在增长。为了方便开发者选型,我们可以从闭源/开源、性能、上下文窗口、成本等维度进行横向对比。
国际主流模型
国际市场的领头羊是 OpenAI 系列,其 GPT‑4 和 o1 推理模型在多任务推理、编码、数学等领域遥遥领先。Anthropic 的 Claude 系列紧随其后,在长文理解和代码生成方面表现突出。Google 的 Gemini 拥有目前最大的上下文窗口(可达 100 万 token,约 40 万字),擅长处理超长文本。Meta 的 LLaMA 系列则是开源社区的基石,衍生出众多微调版本。
以下是国际头部模型的能力简况(数据源自公开评测榜):
| 模型 | 多任务推理(MMLU) | 编码能力 | 数学能力 | 上下文窗口 | 价格水平 |
|---|---|---|---|---|---|
| OpenAI o1 | ★★★★★ | ★★★★☆ | ★★★★★ | 128k | 高 |
| GPT‑4o | ★★★★☆ | ★★★★☆ | ★★★★☆ | 128k | 中高 |
| Claude 3.5 Sonnet | ★★★★☆ | ★★★★★ | ★★★★☆ | 200k | 中 |
| Gemini 1.5 Pro | ★★★★☆ | ★★★☆☆ | ★★★★☆ | 1M | 低 |
| LLaMA 3 405B (开源) | ★★★★☆ | ★★★☆☆ | ★★★☆☆ | 8k~128k | 自托管成本 |
国内主流模型
国内大模型同样百花齐放。根据对话、视觉、文生图、开源等维度的评测:
- 对话模型:字节跳动的豆包 32k 版分数领先,百度文心 4.0 紧随其后。
- 视觉模型:GPT‑4o 几乎满分,豆包和 Claude 表现不俗。
- 文生图模型:华为的盘古 Image 目前排名较高,豆包也位居前列。
- 开源模型:阿里的通义千问(Qwen)72B 占据榜首,DeepSeek‑V2.5 和 LLaMA 3.1 405B 并驾齐驱。
下面的流程图可以帮助你快速梳理模型选择的基本逻辑:
关键对比维度
- 上下文窗口:决定模型一次能处理多少信息。窗口越大,越适合分析长篇文档或进行多轮对话。Gemini 的 100 万 token 窗口几乎可以吞下一整本小说。
- 调用价格:对开发者至关重要。GPT‑4 系列仍然较为昂贵,而 DeepSeek、GLM 等模型的价格极具竞争力。通常,1k token 约对应 300~500 个汉字,你可以根据预估调用量计算成本。
- 闭源 vs 开源:闭源模型通过 API 调用,开箱即用但数据需传输至第三方;开源模型可以本地部署,数据安全性更高,但需要自行维护硬件和推理服务。如果你的机器性能有限,可以先从 API 调用开始实践 Agent 开发。
代码实战:调用大模型 API 的通用示例
为了更具体地体验不同模型的表现,这里提供一个 Python 脚本,同时调用 OpenAI 和 DeepSeek 的 API,发送相同问题并打印回复,方便对比。
前置准备:
- 注册并获取 OpenAI API Key(或使用兼容的代理地址)。
- 注册 DeepSeek 并获取 API Key(platform.deepseek.com)。
- 安装依赖:
pip install openai
可运行代码(请将 your-openai-api-key 和 your-deepseek-api-key 替换为你的真实密钥):
import openai
import time
# 配置两个客户端
openai_client = openai.OpenAI(
api_key="your-openai-api-key", # 替换为你的 OpenAI Key
# 如果使用代理,可以指定 base_url
# base_url="https://api.openai.com/v1"
)
deepseek_client = openai.OpenAI(
api_key="your-deepseek-api-key", # 替换为你的 DeepSeek Key
base_url="https://api.deepseek.com"
)
def ask_model(client, model_name, prompt, max_tokens=200):
start = time.time()
response = client.chat.completions.create(
model=model_name,
messages=[{"role": "user", "content": prompt}],
max_tokens=max_tokens,
temperature=0.7,
)
latency = time.time() - start
content = response.choices[0].message.content
token_usage = response.usage.total_tokens
return content, latency, token_usage
# 测试问题
question = "请用简短的比喻解释什么是大语言模型的注意力机制。"
print("=== OpenAI GPT-4o-mini ===")
try:
ans, lat, tokens = ask_model(openai_client, "gpt-4o-mini", question)
print(ans)
print(f"延迟: {lat:.2f}s, 消耗 token: {tokens}\n")
except Exception as e:
print(f"错误: {e}\n")
print("=== DeepSeek V3 ===")
try:
ans, lat, tokens = ask_model(deepseek_client, "deepseek-chat", question)
print(ans)
print(f"延迟: {lat:.2f}s, 消耗 token: {tokens}")
except Exception as e:
print(f"错误: {e}")
运行后,你可以直观比较两个模型的回答质量、响应速度和 token 消耗。根据任务敏感度、预算和延迟要求,选择合适的模型接入你的 AI Agent。
总结
大语言模型从早期的词向量出发,历经 RNN/LSTM、Transformer,演变为如今的多模态、强推理巨兽。国内外市场涌现出众多闭源与开源模型,各有千秋。在开发 AI Agent 时,没有“万能模型”,需要根据任务类型、上下文长度、成本预算和隐私要求进行权衡。通过调用 API 或自托管,结合灵活的代码封装,你完全可以搭建出基于大模型的智能应用。随着 AGI 的探索不断深入,大模型的能力边界还将持续扩展,而智能体的未来正与此相伴而行。
更多推荐


所有评论(0)