1. vLLM单机单卡部署大模型
·

GPU驱动相关安装
一、基础环境配置
# 检查操作系统版本(推荐Ubuntu 20.04/22.04或CentOS 7/8)
cat /etc/os-release
# 检查内核版本(需要4.15+)
uname -r
cat /etc/os-release
cat /etc/os-release
# 检查GPU硬件
lspci | grep -i nvidia
# 如果看不到GPU,检查BIOS设置和PCIe插槽
# 检查系统资源
free -h
df -h
lscpu
二、安装NVIDIA驱动
# Ubuntu系统安装驱动
# 添加NVIDIA官方仓库
sudo apt update
sudo apt install -y software-properties-common
sudo add-apt-repository ppa:graphics-drivers/ppa
sudo apt install -y alsa-utils
sudo apt update
sudo apt install ubuntu-drivers-common
# 查看推荐的驱动版本
ubuntu-drivers devices
# 安装推荐的驱动
sudo apt install -y nvidia-driver-580
# 重启系统使驱动生效
sudo reboot
# 重启后验证驱动安装
nvidia-smi
# 预期输出:显示GPU信息、驱动版本、CUDA版本
Thu Jan 22 14:19:34 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.126.09 Driver Version: 580.126.09 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 Tesla T4 Off | 00000000:00:0A.0 Off | 0 |
| N/A 42C P8 9W / 70W | 0MiB / 15360MiB | 0% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| No running processes found |
+-----------------------------------------------------------------------------------------+
安装 CUDA
# 卸载旧的CUDA工具包
sudo apt-get purge nvidia-cuda-toolkit
sudo apt-get autoremove
sudo apt-get clean
添加 NVIDIA 官方源
# 添加GPG密钥
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
# 更新源列表
sudo apt-get update
安装 CUDA Toolkit
# 安装CUDA 13.0(和你的驱动版本匹配)
sudo apt-get install -y cuda-13-0
配置环境变量
# 编辑~/.bashrc文件
vim ~/.bashrc
# 在文件末尾添加以下内容
export PATH=/usr/local/cuda-13.0/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda-13.0/lib64:$LD_LIBRARY_PATH
# 保存并退出后,生效配置
source ~/.bashrc
验证安装
# 检查CUDA版本
nvcc -V
# 预期输出应该包含:
# nvcc: NVIDIA (R) Cuda compiler driver
# Copyright (c) 2005-2024 NVIDIA Corporation
# Built on ...
# Cuda compilation tools, release 13.0, V13.0.xxx
三、安装 NVIDIA Container Toolkit
安装 NVIDIA Container Toolkit,参考[Installing the NVIDIA Container Toolkit](
#中科大源安装
#拉取中科大 GPG 密钥并写入
curl -fsSL https://mirrors.ustc.edu.cn/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
#配置适配 Ubuntu 22.04 的 nvidia 源列表
# 生成源列表并添加签名验证(适配 jammy 版本)
curl -s -L https://mirrors.ustc.edu.cn/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
# 关键:替换源中的系统版本为 jammy(Ubuntu 22.04),避免源适配错误
sudo sed -i 's/focal/jammy/g' /etc/apt/sources.list.d/nvidia-container-toolkit.list
# 把源列表里的 nvidia.github.io 替换为 mirrors.ustc.edu.cn
sudo sed -i 's#nvidia.github.io/libnvidia-container#mirrors.ustc.edu.cn/libnvidia-container#g' /etc/apt/sources.list.d/nvidia-container-toolkit.list
#更新 apt 缓存
sudo apt update -y
#安装 nvidia-container-toolkit
sudo apt install -y nvidia-container-toolkit
四、安装docker
# 1. 安装依赖
sudo apt install -y apt-transport-https ca-certificates curl gnupg lsb-release
# 2. 配置阿里云yum源
curl -fsSL http://mirrors.aliyun.com/docker-ce/linux/ubuntu/gpg | sudo gpg --dearmor -o /usr/share/keyrings/docker-archive-keyring.gpg
# 3. 修改 Docker 软件源为阿里云
echo \
"deb [arch=$(dpkg --print-architecture) signed-by=/usr/share/keyrings/docker-archive-keyring.gpg] http://mirrors.aliyun.com/docker-ce/linux/ubuntu \
$(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
# 4. 更新
sudo apt update
# 5. 安装 Docker 最新版本
sudo apt install -y docker-ce docker-ce-cli containerd.io
#验证 Docker 是否安装成功
docker --version
# 3. 配置Docker镜像加速和cgroup驱动、GPU使用
mkdir -p /etc/docker && cat > /etc/docker/daemon.json << 'EOF'
{
"exec-opts": ["native.cgroupdriver=systemd"],
"registry-mirrors": [
"https://mirror.aliyuncs.com",
"https://hub-mirror.c.163.com",
"https://docker.m.daocloud.io"
],
"log-driver": "json-file",
"log-opts": {
"max-size": "100m"
},
"default-runtime": "nvidia",
"runtimes": {
"nvidia": {
"path": "nvidia-container-runtime",
"runtimeArgs": []
}
},
"storage-driver": "overlay2"
}
EOF
# 4. 启动Docker
systemctl daemon-reload && systemctl start docker && systemctl enable docker
# 5. 配置Docker运行时(如果使用Docker)
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
# 安装指定版本 如20.10.24
sudo apt install -y docker-ce=5:20.10.24~3-0~ubuntu-jammy docker-ce-cli=5:20.10.24~3-0~ubuntu-jammy containerd.io
五、验证docker可以使用GPU
#拉取镜像
docker pull nvidia/cuda:11.8.0-base-ubuntu22.04
#运行
docker run --rm --gpus all nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi
docker pull swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04
#运行
docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi
#一键验证
for host in master node1 node2; do echo -e "\n==================== $host Docker GPU 测试 ===================="; ssh $host "docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi"; done
# 预期输出:容器内能看到GPU信息
root@k8s-master:~# docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi
Thu Jan 22 06:33:02 2026
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.126.09 Driver Version: 580.126.09 CUDA Version: 13.0 |
+-----------------------------------------+------------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+========================+======================|
| 0 Tesla T4 Off | 00000000:00:0A.0 Off | 0 |
| N/A 42C P8 9W / 70W | 0MiB / 15360MiB | 0% Default |
| | | N/A |
+-----------------------------------------+------------------------+----------------------+
+-----------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=========================================================================================|
| No running processes found |
+-----------------------------------------------------------------------------------------+
+---------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=======================================================================================|
| No running processes found |
+---------------------------------------------------------------------------------------+
vLLM安装
一、前置条件与准备
# 验证驱动安装
nvidia-smi # 应显示GPU信息及CUDA版本兼容性
# 验证CUDA安装
nvcc -V # 应显示CUDA 12.1版本信息
# 安装基础依赖
sudo apt install -y build-essential gcc g++ cmake git wget curl python3 python3-pip python3-venv
# 配置pip国内镜像(加速安装)
pip3 config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple
pip3 config set global.trusted-host pypi.tuna.tsinghua.edu.cn
二、创建 Python 虚拟环境
# 创建虚拟环境
python3 -m venv vllm-env
# 激活环境
source vllm-env/bin/activate
# 升级pip
pip install --upgrade pip
#注意:机器重启后需要重新激活虚拟环境
source vllm-env/bin/activate
三、安装 vLLM
# 安装vLLM(自动包含PyTorch 2.1+依赖)
pip install vllm # 最新稳定版,支持Qwen3.5{insert\_element\_0\_}
# 验证安装
python -c "from vllm import LLM; print('vLLM安装成功')"
# 查看vLLM库文件路径
python -c "import vllm; print(vllm.__file__)"
# (vllm-env) root@ubuntu:~# python -c "import vllm; print(vllm.__file__)"
# /root/vllm-env/lib/python3.10/site-packages/vllm/__init__.py
可选:从源码编译(支持最新功能)
git clone https://github.com/vllm-project/vllm.git
cd vllm
pip install -e .
四、下载千问 3.5-7B 模型
使用 ModelScope(国内推荐)
# 安装modelscope
pip install modelscope
# 创建 /opt/models/ 目录(-p 表示自动递归创建,不存在就新建)
sudo mkdir -p /opt/models/
# 将文件夹权限赋予当前用户
sudo chown -R $USER:$USER /opt/models/
# 下载模型到文件夹内
modelscope download --model Qwen/Qwen3.5-4B --local_dir /opt/models/Qwen3.5-4B

五、启动
后续启动 vLLM 时,模型路径必须填这个路径:
python -m vllm.entrypoints.openai.api_server \
--model /opt/models/Qwen3.5-4B \
--trust-remote-code \
--dtype float16 \
--port 8000 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.98 \
--max-model-len 4096 \
--enforce-eager
--trust-remote-code 允许加载模型自带的代码,千问模型必须加这个,不加会启动失败!
--dtype float16 指定模型计算精度,使用 16 位浮点数,速度快 + 显存省 + 效果好(T4显卡)
--gpu-memory-utilization 0.98 限制显卡显存使用率,0.98 = 98%
--max-model-len 4096 限制了上下文长度,不然我的显卡会爆显存
--enforce-eager 关闭模型编译,强制使用简单模式
#编译版本启动命令(我的显卡不行)
vllm serve /opt/models/Qwen3.5-4B \
--host 0.0.0.0 \
--port 8000 \
--gpu-memory-utilization 0.95
这个命令是前台启动,测试需要重开两个窗口
窗口1:测试
curl http://10.132.47.60:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "/opt/models/Qwen3.5-4B",
"messages": [{"role": "user", "content": "你好,请介绍一下你自己"}],
"temperature": 0.7
}'
"model": "/opt/models/Qwen3.5-4B" :这是模型的路径
窗口2:查看显卡状态
watch nvidia-smi

差不多14tokens/s
六、后台启动
nohup python -m vllm.entrypoints.openai.api_server \
--model /opt/models/Qwen3.5-4B \
--trust-remote-code \
--dtype float16 \
--port 8000 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.98 \
--max-model-len 4096 \
--enforce-eager > vllm.log 2>&1 &
nohup= 关闭终端也继续运行> vllm.log= 把日志保存到文件里2>&1 &= 完全丢到后台运行
# 查看是否在运行
ps aux | grep vllm
# 查看日志
tail -f vllm.log
# 停止后台服务
pkill -f "vllm"
up python -m vllm.entrypoints.openai.api_server
–model /opt/models/Qwen3.5-4B
–trust-remote-code
–dtype float16
–port 8000
–host 0.0.0.0
–gpu-memory-utilization 0.98
–max-model-len 4096
–enforce-eager > vllm.log 2>&1 &
- `nohup` = 关闭终端也继续运行
- `> vllm.log` = 把日志保存到文件里
- `2>&1 &` = 完全丢到后台运行
查看是否在运行
ps aux | grep vllm
查看日志
tail -f vllm.log
停止后台服务
pkill -f “vllm”

更多推荐



所有评论(0)