本地部署大模型(上):Ollama + Open WebUI 环境搭建与基础使用
一、前言
大语言模型(LLM)已经从实验室走向生产环境,但在实际应用中,很多开发者面临一个共同问题:如何在本地环境中高效、安全地运行和管理大模型?
本文将介绍一种目前最流行的本地大模型部署方案——Ollama + Open WebUI,从环境搭建到基础使用,手把手带你完成整个流程。
适合人群:
- 希望在本地运行大模型的开发者
- 对数据隐私有要求的企业技术人员
- 想要二次开发 AI 应用的工程师
前置要求:
- 基本的命令行操作能力
- 8GB 以上内存(推荐 16GB)
- 20GB 以上可用磁盘空间
二、核心概念
在开始之前,先理清几个关键概念:
2.1 Ollama 是什么?
Ollama 是一个开源的大模型运行框架,类似于 "Docker for LLMs"。它的核心设计目标是:
1. 简化模型管理:一行命令下载、运行、切换模型
2. 自动硬件适配:自动检测 GPU/CPU,智能调度推理资源
3. 标准化 API:提供统一的 REST API 接口,方便集成
Ollama 支持的模型格式主要是 GGUF(GPT-Generated Unified Format),这是一种针对 CPU/GPU 混合推理优化的模型格式。
2.2 Open WebUI 是什么?
Open WebUI 是一个功能丰富的 Web 聊天界面,专门为本地大模型设计。它的特点包括:
- 基于 Svelte + TailwindCSS 的现代化前端
- 支持多用户管理
- 内置 RAG(检索增强生成)功能
- 支持文件上传、图像理解等多模态能力
- 完全开源,可自定义部署
2.3 架构总览
┌─────────────────────────────────────────┐
│ 用户浏览器 │
│ (http://localhost:3000) │
└──────────────────┬──────────────────────┘
│ HTTP
┌──────────────────▼──────────────────────┐
│ Open WebUI │
│ (用户管理 / 对话管理 / RAG / UI) │
└──────────────────┬──────────────────────┘
│ REST API
┌──────────────────▼──────────────────────┐
│ Ollama Server │
│ (localhost:11434) │
│ (模型加载 / 推理调度 / 资源管理) │
└──────────────────┬──────────────────────┘
│
┌──────────────────▼──────────────────────┐
│ 本地模型文件 │
│ (GGUF 格式,存储在磁盘上) │
└─────────────────────────────────────────┘
三、环境搭建
3.1 安装 Ollama
Windows
1. 访问 ollama.com/download
2. 下载 Windows 安装包(约 500MB)
3. 双击运行,按提示完成安装
4. 安装完成后,打开 PowerShell 验证:
ollama --version
# 输出: ollama version 0.9.x (或更高版本)
macOS
# 方式一:直接下载 DMG 安装包
# 方式二:使用 Homebrew
brew install ollama
Linux (Ubuntu/Debian)
curl -fsSL https://ollama.com/install.sh | sh
验证安装
# 检查版本
ollama --version
启动服务(如果未自动启动)
ollama serve
查看已安装模型
ollama list
注意:Ollama 安装后会自动启动一个后台服务,监听
localhost:11434端口。如果端口被占用,启动会失败。
3.2 下载模型
Ollama 的模型管理非常简洁。以下载 Qwen3-8B 为例:
# 下载模型(约 5GB,需要等待)
ollama pull qwen3:8b
查看下载进度
ollama list
运行模型(进入交互模式)
ollama run qwen3:8b
常用模型推荐:
| 模型 | 参数量 | 大小 | 适用场景 |
|---|---|---|---|
qwen3:8b |
8B | ~5GB | 通用助手,中文优秀 |
llama4:scout |
17B | ~10GB | 英文为主,推理能力强 |
gemma3:4b |
4B | ~3GB | 轻量级,速度快 |
deepseek-v3:latest |
671B (MoE) | ~400GB | 顶级性能,需要大显存 |
首次运行测试:
ollama run qwen3:8b
>>> 你好,请用中文介绍一下你自己。
如果看到正常的中文回复,说明模型已成功加载运行。
3.3 安装 Open WebUI
方式一:Docker(推荐)
# 确保 Docker 已安装
docker --version
拉取并运行 Open WebUI
docker run -d
-p 3000:8080
--add-host=host.docker.internal:host-gateway
-v open-webui:/app/backend/data
--name open-webui
--restart always
ghcr.io/open-webui/open-webui:main
参数说明:
- -p 3000:8080:将容器的 8080 端口映射到主机的 3000 端口
- --add-host=host.docker.internal:host-gateway:让容器能访问主机的 Ollama 服务
- -v open-webui:/app/backend/data:持久化存储用户数据
- --restart always:开机自动启动
方式二:pip 安装
# 创建虚拟环境(推荐)
python -m venv open-webui-env
source open-webui-env/bin/activate # Linux/Mac
# open-webui-env\Scripts\activate # Windows
安装
pip install open-webui
启动
open-webui serve
方式三:源码编译
git clone https://github.com/open-webui/open-webui.git
cd open-webui
npm install
npm run build
npm run dev
3.4 首次配置
1. 打开浏览器访问 http://localhost:3000
2. 首次访问需要注册管理员账户(仅本地有效)
3. 注册完成后,进入设置页面
4. 确认 Ollama 服务地址为 http://host.docker.internal:11434(Docker 部署)或 http://localhost:11434(pip 部署)
5. 保存设置后,即可在聊天界面选择模型开始对话
四、基础使用
4.1 基本对话
在 Open WebUI 的聊天界面中:
1. 点击左上角的模型选择器,选择已下载的模型
2. 在输入框中输入问题
3. 按 Enter 发送
Open WebUI 会自动通过 Ollama API 调用本地模型,返回结果。
4.2 对话管理
- 新建对话:点击左上角 "+" 按钮
- 切换对话:在左侧边栏点击历史对话
- 删除对话:在对话上右键选择删除
- 导出对话:支持导出为 Markdown 或 JSON 格式
4.3 系统提示词
Open WebUI 支持为每个对话设置系统提示词(System Prompt),用于定义 AI 的角色和行为。
在对话界面顶部点击设置图标,可以配置:
- 系统提示词
- 温度(Temperature)
- Top-P 采样参数
- 上下文长度限制
4.4 文件上传
Open WebUI 支持上传文件(PDF、TXT 等),实现简单的 RAG 功能:
1. 点击输入框左侧的附件按钮
2. 选择要上传的文件
3. 文件内容会被自动提取并注入到对话上下文中
4. AI 会基于文件内容回答问题
注意:文件上传功能需要模型支持足够长的上下文窗口。8B 模型通常支持 4K-8K token 的上下文。
4.5 多模型切换
Open WebUI 的一大优势是可以同时管理多个模型:
1. 在 Ollama 中下载多个模型:ollama pull qwen3:8b、ollama pull gemma3:4b
2. 在 Open WebUI 的模型选择器中可以看到所有可用模型
3. 针对不同任务选择合适的模型
五、常见问题
Q1:Ollama 启动失败,端口被占用
# 查看占用 11434 端口的进程
lsof -i :11434 # Linux/Mac
netstat -ano | findstr 11434 # Windows
杀掉占用进程后重启
ollama serve
Q2:Docker 容器无法连接 Ollama
确保使用了 --add-host=host.docker.internal:host-gateway 参数,或者使用 --network host 模式(Linux):
docker run --network host -v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Q3:模型下载速度慢
可以使用镜像源加速:
# 设置环境变量
export OLLAMA_REGISTRY=https://mirror.ollama.com
Q4:GPU 未被使用
检查 NVIDIA 驱动和 CUDA 版本:
nvidia-smi # 查看 GPU 状态
ollama run qwen3:8b # 运行时查看日志,确认是否使用 GPU
六、总结
本文完成了 Ollama + Open WebUI 的基础环境搭建。回顾关键步骤:
1. 安装 Ollama → 拉取模型 → 验证运行
2. 安装 Open WebUI → 配置连接 → 开始使用
在下一篇《本地部署大模型(下)》中,我们将深入探讨:
- 进阶配置与性能调优
- 模型管理最佳实践
- RAG 知识库搭建
- API 集成与二次开发
- 常见踩坑与解决方案
如果本文对你有帮助,欢迎点赞收藏。有问题欢迎在评论区讨论。
更多推荐



所有评论(0)