AI Agent从无到有7: 从零搞定闭源与开源大模型资源
纲要
- 大模型资源:AI Agent 的“燃料”
- 闭源模型 vs 开源模型
- 资源获取的核心痛点
- 闭源模型:以智谱 AI 为例
- 注册与 API Key 申请流程
- 模型列表与适用场景
- 并发限制与速率控制
- 计费模式与价格参考
- 完整的 Python 调用示例(可直接运行)
- 开源模型:使用
Ollama本地部署Ollama简介与安装- 常用命令速查
- 拉取并运行第一个模型(以
deepseek-r1:7b为例) - 与模型交互:对话与退出
Ollama的 HTTP API 及 Python 调用示例- 硬件需求建议
- 闭源 vs 开源:选型速查表
- 总结与下一步
大模型资源:AI Agent 的“燃料”
对于刚刚入门的 AI Agent 开发者来说,第一步往往不是写代码,而是找到可用的模型资源。无论是构建对话机器人、知识库问答还是自动化工作流,背后都需要一个“超级大脑”——大语言模型。目前获取模型的主流方式分为两类:
- 闭源模型:通过 API 调用,由厂商托管,开箱即用,按量付费。
- 开源模型:下载权重文件本地运行,自己掌控,无需网络即可推理,但需要硬件支持。
这一章将手把手带你完成两个实操任务:在智谱 AI 平台申请闭源模型的 API Key,以及使用 Ollama 在本地部署开源模型。完成之后,你就拥有了继续探索 Agent 开发的模型基础。
闭源模型:以智谱 AI 为例获取 API 资源
注册与申请 API Key
智谱 AI 提供了丰富的模型矩阵,包括语言模型、多模态模型等,其开发者平台对国内用户非常友好,且价格实惠。申请流程如下:
拿到 Key 后,你可以在控制台看到完整的模型列表。当前推荐关注的几个模型:
GLM-4-Plus:旗舰语言模型,128k 上下文,综合能力强。GLM-4-Flash:轻量高速版,最大并发数 200,适合高吞吐场景。GLM-4V-Plus:多模态模型,支持图像理解。
并发限制与速率控制
在实际开发 Agent 时,并发限制是一个容易被忽略的细节。智谱各模型的默认并发数如下:
| 模型 | 最大并发数 |
|---|---|
| GLM-4-Plus | 50 |
| GLM-4-Flash | 200 |
| GLM-4V-Plus | 30(参考值) |
如果你的应用同时有大量请求,前端需要实现限流或排队机制,否则超出并发时会直接报错。生产环境中建议选择 Flash 以获得更高的吞吐,或将请求进行异步化管理。
计费模式与价格
智谱采用按量计费,每 1000 token 为一个计价单位。以 GLM-4-Plus 为例,单次交互(输入+输出)仅需 0.05 元 / 千 token,对个人开发者十分友好。你可以在控制台在线充值,也可以设定用量告警。
完整的 Python 调用示例
下面是一个可直接运行的脚本,调用智谱 GLM-4-Flash 模型实现一个简单的对话。
步骤:
- 安装依赖:
pip install openai - 将
your-api-key替换为你的真实 Key。 - 运行脚本。
import os
from openai import OpenAI
# 智谱 AI 的兼容 OpenAI 接口
client = OpenAI(
api_key="your-api-key", # 替换为你的智谱 API Key
base_url="https://open.bigmodel.cn/api/paas/v4/"
)
def chat_with_glm(prompt: str, model: str = "glm-4-flash") -> str:
"""
发送用户消息并返回模型回复
"""
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": prompt}
],
temperature=0.7,
max_tokens=512,
)
return response.choices[0].message.content
if __name__ == "__main__":
# 简单测试
question = "请用一句话解释什么是 AI Agent"
answer = chat_with_glm(question)
print("用户:", question)
print("助手:", answer)
# 如果你需要测试多模态,可以切换为 glm-4v-plus 并传入图片(此处略)
运行后,你应该能立刻得到模型的回复。这种通过 API 调用的方式无需关心底层 GPU,非常适合快速原型开发和中小型项目。
开源模型:使用 Ollama 本地部署你的第一个大模型
如果你希望数据完全本地化、避免网络依赖,或者想自由切换不同模型,那么 Ollama 是目前最简便的开源模型托管工具。它支持 macOS、Linux 和 Windows,一键拉取模型,命令行直接对话。
安装 Ollama
访问 ollama.com 下载对应平台版本并安装。安装完成后,打开终端(命令行),输入 ollama 并回车,若显示帮助信息则表示安装成功。
# 查看版本
ollama -v
常用命令速查
| 命令 | 作用 |
|---|---|
ollama list |
查看本地已下载的模型 |
ollama pull <模型名> |
从仓库拉取模型(例如 deepseek-r1:7b) |
ollama run <模型名> |
运行模型并进入交互对话 |
/bye |
退出对话 |
ollama rm <模型名> |
删除本地模型 |
拉取并运行你的第一个模型
以最近大热的推理模型 DeepSeek-R1 的 7B 版本为例:
# 拉取模型(约 4.7GB)
ollama pull deepseek-r1:7b
# 查看本地模型列表
ollama list
你会看到类似输出:
NAME ID SIZE MODIFIED
deepseek-r1:7b 6e4c38f0a6e3 4.7 GB 2 minutes ago
现在启动对话:
ollama run deepseek-r1:7b
模型加载后,你可以直接输入问题,它会先展示自己的思考过程(Chain of Thought),然后给出最终答案。例如:
>>> 什么是 AI Agent?
(思考过程...)
AI Agent 是一种能够感知环境、自主决策并执行动作的智能实体...
想退出时,输入 /bye
通过 API 调用本地 Ollama 模型
Ollama 除了命令行交互,还提供了兼容 OpenAI 格式的 HTTP API(默认监听 http://localhost:11434)。这意味着你可以用熟悉的 openai Python 库直接调用本地模型,无需联网,也不消耗 token 费用。
下面是一个完整的 Python 示例,确保你已经用 ollama pull 下载了 qwen2.5:7b(或任意你喜欢的模型)。
from openai import OpenAI
# 连接到本地 Ollama 服务
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 本地服务任意值即可
)
def ask_local_model(prompt: str, model: str = "qwen2.5:7b") -> str:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
temperature=0.7,
max_tokens=512
)
return response.choices[0].message.content
if __name__ == "__main__":
print("本地模型回复:", ask_local_model("简要说明 RAG 的工作原理"))
运行这段代码前,请确保:
- Ollama 正在后台运行(安装后一般默认开机启动,或手动执行
ollama serve)。 - 目标模型已下载。
你会发现,本地推理速度取决于硬件。对于 7B 模型,推荐至少 8GB 显存的 GPU(如 RTX 3060 以上),若仅用 CPU 推理,速度会慢很多但依然可用。对于 13B 及以上模型,建议上云 GPU 实例或配备更大显存的服务器。
其他开源模型部署工具
除了 Ollama,你还可以尝试:
- LM Studio:提供图形界面,可直接从 Hugging Face 下载模型并聊天,操作更直观。
- vLLM / Text Generation Inference:适用于生产环境的高性能推理引擎。
但作为入门,Ollama 的简洁性无疑是最佳选择。
闭源 vs 开源:一张表帮你决策
| 维度 | 闭源 API(如智谱、OpenAI) | 开源本地部署(如 Ollama) |
|---|---|---|
| 使用门槛 | 极低,注册即用 | 需要安装配置,对硬件有要求 |
| 推理成本 | 按 token 计费,大规模时较贵 | 一次性硬件投入,后续几乎免费 |
| 数据隐私 | 数据上传至厂商服务器 | 完全本地,数据不外泄 |
| 模型更新 | 厂商自动升级 | 需手动拉取新版本 |
| 定制化能力 | 仅能通过提示词微调 | 可微调、裁剪、量化 |
| 适用场景 | 快速验证、小型项目 | 隐私敏感、高频调用、需深度定制 |
在实际开发中,你可以先用闭源 API 跑通原型,再根据成本、隐私、延迟等需求逐步迁移到本地模型。
总结与下一步
通过本章的两个实操,你已经掌握了:
- 在智谱 AI 平台获取闭源 API Key 并使用 Python 调用;
- 使用 Ollama 在本地下载、运行开源模型,并通过 API 集成到自己的代码中。
这两种方式足以覆盖绝大多数 Agent 开发场景。模型资源就绪后,接下来就可以学习如何设计提示词、搭建 RAG 知识库、编排多步工作流,让 Agent 真正“活”起来。
更多推荐


所有评论(0)