纲要

  • 大模型资源:AI Agent 的“燃料”
    • 闭源模型 vs 开源模型
    • 资源获取的核心痛点
  • 闭源模型:以智谱 AI 为例
    • 注册与 API Key 申请流程
    • 模型列表与适用场景
    • 并发限制与速率控制
    • 计费模式与价格参考
    • 完整的 Python 调用示例(可直接运行)
  • 开源模型:使用 Ollama 本地部署
    • Ollama 简介与安装
    • 常用命令速查
    • 拉取并运行第一个模型(以 deepseek-r1:7b 为例)
    • 与模型交互:对话与退出
    • Ollama 的 HTTP API 及 Python 调用示例
    • 硬件需求建议
  • 闭源 vs 开源:选型速查表
  • 总结与下一步

大模型资源:AI Agent 的“燃料”

对于刚刚入门的 AI Agent 开发者来说,第一步往往不是写代码,而是找到可用的模型资源。无论是构建对话机器人、知识库问答还是自动化工作流,背后都需要一个“超级大脑”——大语言模型。目前获取模型的主流方式分为两类:

  • 闭源模型:通过 API 调用,由厂商托管,开箱即用,按量付费。
  • 开源模型:下载权重文件本地运行,自己掌控,无需网络即可推理,但需要硬件支持。

这一章将手把手带你完成两个实操任务:在智谱 AI 平台申请闭源模型的 API Key,以及使用 Ollama 在本地部署开源模型。完成之后,你就拥有了继续探索 Agent 开发的模型基础。

闭源模型:以智谱 AI 为例获取 API 资源

注册与申请 API Key

智谱 AI 提供了丰富的模型矩阵,包括语言模型、多模态模型等,其开发者平台对国内用户非常友好,且价格实惠。申请流程如下:

访问 open.bigmodel.cn

注册/登录账号

进入控制台

点击右上角钥匙图标

创建新的 API Key

填写名称并确认

复制 Key 保存备用

拿到 Key 后,你可以在控制台看到完整的模型列表。当前推荐关注的几个模型:

  • GLM-4-Plus:旗舰语言模型,128k 上下文,综合能力强。
  • GLM-4-Flash:轻量高速版,最大并发数 200,适合高吞吐场景。
  • GLM-4V-Plus:多模态模型,支持图像理解。

并发限制与速率控制

在实际开发 Agent 时,并发限制是一个容易被忽略的细节。智谱各模型的默认并发数如下:

模型 最大并发数
GLM-4-Plus 50
GLM-4-Flash 200
GLM-4V-Plus 30(参考值)

如果你的应用同时有大量请求,前端需要实现限流或排队机制,否则超出并发时会直接报错。生产环境中建议选择 Flash 以获得更高的吞吐,或将请求进行异步化管理。

计费模式与价格

智谱采用按量计费,每 1000 token 为一个计价单位。以 GLM-4-Plus 为例,单次交互(输入+输出)仅需 0.05 元 / 千 token,对个人开发者十分友好。你可以在控制台在线充值,也可以设定用量告警。

完整的 Python 调用示例

下面是一个可直接运行的脚本,调用智谱 GLM-4-Flash 模型实现一个简单的对话。

步骤

  1. 安装依赖:pip install openai
  2. your-api-key 替换为你的真实 Key。
  3. 运行脚本。
import os
from openai import OpenAI

# 智谱 AI 的兼容 OpenAI 接口
client = OpenAI(
    api_key="your-api-key",  # 替换为你的智谱 API Key
    base_url="https://open.bigmodel.cn/api/paas/v4/"
)

def chat_with_glm(prompt: str, model: str = "glm-4-flash") -> str:
    """
    发送用户消息并返回模型回复
    """
    response = client.chat.completions.create(
        model=model,
        messages=[
            {"role": "user", "content": prompt}
        ],
        temperature=0.7,
        max_tokens=512,
    )
    return response.choices[0].message.content

if __name__ == "__main__":
    # 简单测试
    question = "请用一句话解释什么是 AI Agent"
    answer = chat_with_glm(question)
    print("用户:", question)
    print("助手:", answer)
    
    # 如果你需要测试多模态,可以切换为 glm-4v-plus 并传入图片(此处略)

运行后,你应该能立刻得到模型的回复。这种通过 API 调用的方式无需关心底层 GPU,非常适合快速原型开发和中小型项目。

开源模型:使用 Ollama 本地部署你的第一个大模型

如果你希望数据完全本地化、避免网络依赖,或者想自由切换不同模型,那么 Ollama 是目前最简便的开源模型托管工具。它支持 macOS、Linux 和 Windows,一键拉取模型,命令行直接对话。

安装 Ollama

访问 ollama.com 下载对应平台版本并安装。安装完成后,打开终端(命令行),输入 ollama 并回车,若显示帮助信息则表示安装成功。

# 查看版本
ollama -v

常用命令速查

命令 作用
ollama list 查看本地已下载的模型
ollama pull <模型名> 从仓库拉取模型(例如 deepseek-r1:7b
ollama run <模型名> 运行模型并进入交互对话
/bye 退出对话
ollama rm <模型名> 删除本地模型

拉取并运行你的第一个模型

以最近大热的推理模型 DeepSeek-R1 的 7B 版本为例:

# 拉取模型(约 4.7GB)
ollama pull deepseek-r1:7b

# 查看本地模型列表
ollama list

你会看到类似输出:

NAME                     ID              SIZE      MODIFIED
deepseek-r1:7b           6e4c38f0a6e3    4.7 GB    2 minutes ago

现在启动对话:

ollama run deepseek-r1:7b

模型加载后,你可以直接输入问题,它会先展示自己的思考过程(Chain of Thought),然后给出最终答案。例如:

>>> 什么是 AI Agent?
(思考过程...)
AI Agent 是一种能够感知环境、自主决策并执行动作的智能实体...

想退出时,输入 /bye

通过 API 调用本地 Ollama 模型

Ollama 除了命令行交互,还提供了兼容 OpenAI 格式的 HTTP API(默认监听 http://localhost:11434)。这意味着你可以用熟悉的 openai Python 库直接调用本地模型,无需联网,也不消耗 token 费用。

下面是一个完整的 Python 示例,确保你已经用 ollama pull 下载了 qwen2.5:7b(或任意你喜欢的模型)。

from openai import OpenAI

# 连接到本地 Ollama 服务
client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # 本地服务任意值即可
)

def ask_local_model(prompt: str, model: str = "qwen2.5:7b") -> str:
    response = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        temperature=0.7,
        max_tokens=512
    )
    return response.choices[0].message.content

if __name__ == "__main__":
    print("本地模型回复:", ask_local_model("简要说明 RAG 的工作原理"))

运行这段代码前,请确保:

  • Ollama 正在后台运行(安装后一般默认开机启动,或手动执行 ollama serve)。
  • 目标模型已下载。

你会发现,本地推理速度取决于硬件。对于 7B 模型,推荐至少 8GB 显存的 GPU(如 RTX 3060 以上),若仅用 CPU 推理,速度会慢很多但依然可用。对于 13B 及以上模型,建议上云 GPU 实例或配备更大显存的服务器。

其他开源模型部署工具

除了 Ollama,你还可以尝试:

  • LM Studio:提供图形界面,可直接从 Hugging Face 下载模型并聊天,操作更直观。
  • vLLM / Text Generation Inference:适用于生产环境的高性能推理引擎。

但作为入门,Ollama 的简洁性无疑是最佳选择。

闭源 vs 开源:一张表帮你决策

维度 闭源 API(如智谱、OpenAI) 开源本地部署(如 Ollama)
使用门槛 极低,注册即用 需要安装配置,对硬件有要求
推理成本 按 token 计费,大规模时较贵 一次性硬件投入,后续几乎免费
数据隐私 数据上传至厂商服务器 完全本地,数据不外泄
模型更新 厂商自动升级 需手动拉取新版本
定制化能力 仅能通过提示词微调 可微调、裁剪、量化
适用场景 快速验证、小型项目 隐私敏感、高频调用、需深度定制

在实际开发中,你可以先用闭源 API 跑通原型,再根据成本、隐私、延迟等需求逐步迁移到本地模型。

总结与下一步

通过本章的两个实操,你已经掌握了:

  • 在智谱 AI 平台获取闭源 API Key 并使用 Python 调用;
  • 使用 Ollama 在本地下载、运行开源模型,并通过 API 集成到自己的代码中。

这两种方式足以覆盖绝大多数 Agent 开发场景。模型资源就绪后,接下来就可以学习如何设计提示词、搭建 RAG 知识库、编排多步工作流,让 Agent 真正“活”起来。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐