Ollama 部署与 vLLM 部署的区别

部署方式

Ollama 是一个本地化的大模型运行工具,支持在个人计算机上快速下载和运行开源大模型。它通过命令行工具提供简单的模型管理功能,适合开发者和研究者快速实验。直接官网下载就可以直接使用。

vLLM 是一个高性能的推理和服务引擎,专为大规模语言模型设计。它支持分布式部署,适合生产环境中的高并发需求,通常需要 Kubernetes 或其他容器编排工具支持。

性能优化

Ollama 的优化重点在于简化本地运行流程,支持模型的量化版本以减少资源占用。它的性能受限于单机资源,适合低延迟的本地测试和小规模应用。测试在一块L40显卡通过ollama部署deepseek32b大模型只使用了20G左右显存。设置四卡并行并没有提升运行速度很多。

vLLM 采用 PagedAttention 技术优化显存管理,显著提高吞吐量。它支持动态批处理和连续批处理,适合处理高并发请求,尤其在多 GPU 环境下表现优异。在四块L40显卡上面测试部署DeepSeek-R1-Distill-Qwen-32B-AWQ ,设置24并行速度快更能充分运用显卡性能。

vllm运行脚本:

python -m vllm.entrypoints.openai.api_server \
--served-model-name DeepSeek-R1-Distill-Qwen-32B-AWQ \
--model /share/home/xiexiangyu/.cache/modelscope/hub/models/Valdemardi/DeepSeek-R1-Distill-Qwen-32B-AWQ \
--host 0.0.0.0 \
--port 8765 \
--max-model-len 10240 \
--gpu-memory-utilization 0.80 \
--tensor-parallel-size 4 \
--quantization awq \
--trust-remote-code \
--max-num-batched-tokens 16384 \
--max-num-seqs 24 \
--enable-prefix-caching \
--disable-log-requests False
vllm运行信息
显存使用情况
模型支持

Ollama 主要支持 Llama、Mistral 等流行开源模型,并提供社区贡献的模型库。用户可以通过简单的命令切换不同模型,适合快速尝试多种模型。

vLLM 支持更广泛的大模型,包括 Llama、GPT-3 等,并提供与 Hugging Face 模型的深度集成。它的架构设计更适合复杂模型的高效推理。

使用场景

Ollama 适用于个人开发者、教育场景和小型项目,其设计初衷是降低大模型的使用门槛。它不需要复杂的配置即可开始使用。

vLLM 面向企业级应用,适合需要高吞吐量和低延迟的生产环境。它在云服务和 API 后端部署中表现突出,支持多租户和资源隔离。

扩展性

Ollama 的扩展性有限,主要依赖本地硬件资源。虽然支持部分自定义设置,但不适合大规模扩展。

vLLM 提供高度可扩展的架构,支持水平扩展和负载均衡。它的设计允许灵活调整资源分配,满足不同规模的业务需求。

生态系统

Ollama 拥有活跃的社区支持,提供大量预配置模型和教程。它的生态系统更偏向于个人用户和小型项目。

ollama下载大模型

ollama pull llama3.2:1b

vLLM 作为专业级工具,与主流云服务和工具链深度集成。它的生态系统更适合企业级 AI 基础设施。

vllm下载DeepSeek模型

国内无法科学上网可以使用魔搭社区来下载很是方便。

pip install modelscope
modelscope download --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐