纲要

  • 大语言模型的定义与基础
    • LLM 概念:基于深度学习的自然语言处理模型
    • 核心能力:文本生成、分类、摘要、翻译等
  • 技术演进路线
    • 词向量与 One‑Hot 编码的局限
    • 词嵌入:低维稠密向量与语义关系
    • RNN / LSTM:序列建模与长短期记忆
    • Transformer:自注意力机制与预训练范式
    • BERT vs GPT:微调与多任务统一
    • 多模态与推理模型
    • 终极目标:人工通用智能(AGI
  • 当前主流 LLM 格局
    • 国际模型:OpenAI o1/GPT‑4、Claude、Gemini、LLaMA
    • 国内模型:豆包、文心、通义千问、DeepSeek、GLM
    • 能力维度:推理、编码、数学、视觉、文生图
  • 模型选择关键因素
    • 闭源 vs 开源
    • 上下文窗口大小
    • 调用成本
    • 任务匹配度
  • 代码实战:调用大模型 API 的通用封装
    • 使用 Python 同时调用 OpenAI 和 DeepSeek
    • 比较回复质量与成本
  • 总结与趋势

大语言模型:AI Agent 的超级大脑

随着 AI Agent 的兴起,几乎所有智能化应用都围绕着一个核心组件运转——大语言模型(Large Language Model,简称 LLM)。对于刚刚踏入这一领域的开发者而言,理解 LLM 是什么、它经历了怎样的发展、目前有哪些主流选择,是后续构建 Agent 不可或缺的理论基础。

LLM 是基于深度学习的自然语言处理模型,能够学习自然语言的语法和语义,并生成人类可读的文本。这类模型通常拥有数十亿到数万亿的参数,通过在互联网海量文本上进行训练,掌握了文本生成、分类、摘要、翻译、语音识别等多种能力。而这一切能力的源头,可以追溯到一项颠覆性的架构:Transformer

从词向量到 Transformer:大模型的“前世今生”

要让计算机理解自然语言,第一步是将文字转换为数字。这一过程经历了多次迭代。

词向量与 One‑Hot 编码

最朴素的想法是“一个词一个位置”。例如,假设语料中只有“猫、狗、牛、羊”四个词,那么可以这样表示:

  • 猫 → [1, 0, 0, 0]
  • 狗 → [0, 1, 0, 0]
  • 牛 → [0, 0, 1, 0]
  • 羊 → [0, 0, 0, 1]

这种 One‑Hot 编码虽然简单,但有两个致命缺陷:无法表达词与词之间的关系,且向量维度随词汇量线性膨胀,导致计算和存储效率极低。

词嵌入:让语义在空间中对齐

词嵌入(Word Embedding)将高维稀疏的 One‑Hot 向量映射到一个低维稠密的向量空间。在这个空间里,语义相近的词距离更近。例如,“牛”和“羊”同属家畜,其向量会彼此靠近;“猫”和“狗”同为宠物,也会聚成一簇。这种表示不仅维度大幅降低,还具备优秀的迁移学习能力,可以在不同自然语言任务中复用。

下面用一段简单的 Python 代码演示词嵌入的效果(使用 Gensim 加载预训练的 Glove 模型):

import gensim.downloader as api

# 加载小型 GloVe 词向量(首次运行会自动下载)
model = api.load("glove-wiki-gigaword-50")

# 查看词语向量
print("猫的向量(部分):", model["cat"][:10])

# 计算语义相似度
print("猫和狗的相似度:", model.similarity("cat", "dog"))
print("猫和汽车的相似度:", model.similarity("cat", "car"))

# 寻找与“国王”语义最接近的词(经典类比:国王 - 男人 + 女人 ≈ 王后)
result = model.most_similar(positive=["king", "woman"], negative=["man"], topn=1)
print("king - man + woman =", result[0][0])

运行这段代码,你会直观地看到词嵌入如何捕捉语义关系。

从 RNN 到 LSTM:处理序列信息

自然语言是典型的序列数据——单词的顺序直接影响含义。循环神经网络(RNN)专门为序列建模而设计,它按顺序处理每一个单词,并将前文信息传递给后续步骤。但普通 RNN 会遭遇短期记忆丢失和训练成本高的问题。

长短时记忆网络(LSTM)引入“记忆单元”和门控机制,能够选择性地记住重要信息、遗忘无关内容,从而在机器翻译、语音识别等任务中表现优异。不过,这两类模型仍然需要大量人工标注数据,且在并行计算方面效率低下。

Transformer 与预训练革命

2017 年,Google 提出 Transformer 架构,彻底改变了 NLP 的范式。其核心是自注意力机制,让模型在理解一个词时,能够同时关注句子中所有其他词,而不必像 RNN 那样顺序传递。这使得模型可以:

  • 并行训练,大幅缩短训练时间;
  • 捕捉长距离依赖,缓解遗忘问题;
  • 采用自监督学习,在海量无标注文本上进行预训练,不再依赖昂贵的人工标注。

Transformer 就像一个“超级完形填空”机器:给定一段话并挖去一些词,它通过上下文预测被挖掉的内容,从而学会语言的深层规律。

Transformer 基础上,BERT 通过“掩码语言模型”进行预训练,然后为每个具体任务(如情感分析、问答)添加一个微调层。其缺点是一个任务一个模型,通用性较差。而 GPT 系列采用自回归生成方式,并逐步统一为“预训练 + 提示(Prompt)”范式,使得同一个模型可以完成写作、翻译、聊天等多种任务。

2022 年底 ChatGPT 的问世,标志着大模型真正走向通用化和实用化。下图简要概括了从词向量到现代 LLM 的发展主线:

早期 词向量/One-Hot 稀疏高维, 无语义 词嵌入(Word2Vec/GloVe) 低维稠密, 语义相似性 序列建模 RNN 处理序列数据, 短期记忆丢失 LSTM 长短期记忆, 门控机制 架构突破 Transformer(2017) 自注意力, 并行训练, 自监督预训练 BERT 掩码预训练+微调, 单任务专用 GPT系列 自回归生成, 多任务统一 现代LLM ChatGPT/GPT-4 通用对话, 推理, 多模态 AGI探索 通用人工智能 大语言模型演进路线

多模态与推理模型:未来方向

当前最前沿的大模型已经突破纯文本的边界,进入多模态时代:能够同时理解文字、图像、声音甚至视频。这就像拥有一个全能助手,既能听懂你的口头指令,又能看懂你展示的图片,还能分析视频内容。在医疗诊断中,它可以同时分析病患症状描述和 X 光片;在教育领域,它能结合学生的口语提问和手写作业给出个性化指导。

此外,以 OpenAI o1 为代表的推理模型在回答问题前会进行“思考”——内部执行多步推理过程,从而在数学、编程等复杂任务上大幅超越传统模型。

这些技术的持续进化,最终指向一个宏大目标:人工通用智能(AGI)。AGI 不仅能完成特定任务,还能像人类一样思考、学习、推理,适应各种未知环境。尽管伦理和安全问题尚待解决,但大模型无疑是通往 AGI 的关键阶梯。

全景扫描:国内外主流大模型

当前大模型市场竞争激烈,模型数量几乎每天都在增长。为了方便开发者选型,我们可以从闭源/开源、性能、上下文窗口、成本等维度进行横向对比。

国际主流模型

国际市场的领头羊是 OpenAI 系列,其 GPT‑4 和 o1 推理模型在多任务推理、编码、数学等领域遥遥领先。Anthropic 的 Claude 系列紧随其后,在长文理解和代码生成方面表现突出。Google 的 Gemini 拥有目前最大的上下文窗口(可达 100 万 token,约 40 万字),擅长处理超长文本。Meta 的 LLaMA 系列则是开源社区的基石,衍生出众多微调版本。

以下是国际头部模型的能力简况(数据源自公开评测榜):

模型 多任务推理(MMLU) 编码能力 数学能力 上下文窗口 价格水平
OpenAI o1 ★★★★★ ★★★★☆ ★★★★★ 128k
GPT‑4o ★★★★☆ ★★★★☆ ★★★★☆ 128k 中高
Claude 3.5 Sonnet ★★★★☆ ★★★★★ ★★★★☆ 200k
Gemini 1.5 Pro ★★★★☆ ★★★☆☆ ★★★★☆ 1M
LLaMA 3 405B (开源) ★★★★☆ ★★★☆☆ ★★★☆☆ 8k~128k 自托管成本

国内主流模型

国内大模型同样百花齐放。根据对话、视觉、文生图、开源等维度的评测:

  • 对话模型:字节跳动的豆包 32k 版分数领先,百度文心 4.0 紧随其后。
  • 视觉模型:GPT‑4o 几乎满分,豆包和 Claude 表现不俗。
  • 文生图模型:华为的盘古 Image 目前排名较高,豆包也位居前列。
  • 开源模型:阿里的通义千问(Qwen)72B 占据榜首,DeepSeek‑V2.5 和 LLaMA 3.1 405B 并驾齐驱。

下面的流程图可以帮助你快速梳理模型选择的基本逻辑:

对话

视觉

长文本

低成本

开始选型

是否可访问国外API?

是否需要最强推理?

倾向开源自托管?

OpenAI o1 / GPT-4o

Claude / Gemini

Qwen2 / DeepSeek / LLaMA3

任务类型?

豆包 / 文心4.0

GPT-4o 或 豆包视觉

Gemini (1M窗口)

DeepSeek / GLM

关键对比维度

  • 上下文窗口:决定模型一次能处理多少信息。窗口越大,越适合分析长篇文档或进行多轮对话。Gemini 的 100 万 token 窗口几乎可以吞下一整本小说。
  • 调用价格:对开发者至关重要。GPT‑4 系列仍然较为昂贵,而 DeepSeek、GLM 等模型的价格极具竞争力。通常,1k token 约对应 300~500 个汉字,你可以根据预估调用量计算成本。
  • 闭源 vs 开源:闭源模型通过 API 调用,开箱即用但数据需传输至第三方;开源模型可以本地部署,数据安全性更高,但需要自行维护硬件和推理服务。如果你的机器性能有限,可以先从 API 调用开始实践 Agent 开发。

代码实战:调用大模型 API 的通用示例

为了更具体地体验不同模型的表现,这里提供一个 Python 脚本,同时调用 OpenAI 和 DeepSeek 的 API,发送相同问题并打印回复,方便对比。

前置准备

  1. 注册并获取 OpenAI API Key(或使用兼容的代理地址)。
  2. 注册 DeepSeek 并获取 API Key(platform.deepseek.com)。
  3. 安装依赖:
    pip install openai
    

可运行代码(请将 your-openai-api-keyyour-deepseek-api-key 替换为你的真实密钥):

import openai
import time

# 配置两个客户端
openai_client = openai.OpenAI(
    api_key="your-openai-api-key",  # 替换为你的 OpenAI Key
    # 如果使用代理,可以指定 base_url
    # base_url="https://api.openai.com/v1"
)

deepseek_client = openai.OpenAI(
    api_key="your-deepseek-api-key",  # 替换为你的 DeepSeek Key
    base_url="https://api.deepseek.com"
)

def ask_model(client, model_name, prompt, max_tokens=200):
    start = time.time()
    response = client.chat.completions.create(
        model=model_name,
        messages=[{"role": "user", "content": prompt}],
        max_tokens=max_tokens,
        temperature=0.7,
    )
    latency = time.time() - start
    content = response.choices[0].message.content
    token_usage = response.usage.total_tokens
    return content, latency, token_usage

# 测试问题
question = "请用简短的比喻解释什么是大语言模型的注意力机制。"

print("=== OpenAI GPT-4o-mini ===")
try:
    ans, lat, tokens = ask_model(openai_client, "gpt-4o-mini", question)
    print(ans)
    print(f"延迟: {lat:.2f}s, 消耗 token: {tokens}\n")
except Exception as e:
    print(f"错误: {e}\n")

print("=== DeepSeek V3 ===")
try:
    ans, lat, tokens = ask_model(deepseek_client, "deepseek-chat", question)
    print(ans)
    print(f"延迟: {lat:.2f}s, 消耗 token: {tokens}")
except Exception as e:
    print(f"错误: {e}")

运行后,你可以直观比较两个模型的回答质量、响应速度和 token 消耗。根据任务敏感度、预算和延迟要求,选择合适的模型接入你的 AI Agent。

总结

大语言模型从早期的词向量出发,历经 RNN/LSTMTransformer,演变为如今的多模态、强推理巨兽。国内外市场涌现出众多闭源与开源模型,各有千秋。在开发 AI Agent 时,没有“万能模型”,需要根据任务类型、上下文长度、成本预算和隐私要求进行权衡。通过调用 API 或自托管,结合灵活的代码封装,你完全可以搭建出基于大模型的智能应用。随着 AGI 的探索不断深入,大模型的能力边界还将持续扩展,而智能体的未来正与此相伴而行。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐