在这里插入图片描述

GPU驱动相关安装

一、基础环境配置

# 检查操作系统版本(推荐Ubuntu 20.04/22.04或CentOS 7/8)
cat /etc/os-release

# 检查内核版本(需要4.15+)
uname -r
cat /etc/os-release
cat /etc/os-release
# 检查GPU硬件
lspci | grep -i nvidia

# 如果看不到GPU,检查BIOS设置和PCIe插槽

# 检查系统资源
free -h
df -h
lscpu

二、安装NVIDIA驱动

# Ubuntu系统安装驱动
# 添加NVIDIA官方仓库
sudo apt update
sudo apt install -y software-properties-common
sudo add-apt-repository ppa:graphics-drivers/ppa
sudo apt install -y alsa-utils
sudo apt update
sudo apt install ubuntu-drivers-common
# 查看推荐的驱动版本
ubuntu-drivers devices

# 安装推荐的驱动
sudo apt install -y nvidia-driver-580

# 重启系统使驱动生效
sudo reboot

# 重启后验证驱动安装
nvidia-smi

# 预期输出:显示GPU信息、驱动版本、CUDA版本
Thu Jan 22 14:19:34 2026       
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.126.09             Driver Version: 580.126.09     CUDA Version: 13.0     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  Tesla T4                       Off |   00000000:00:0A.0 Off |                    0 |
| N/A   42C    P8              9W /   70W |       0MiB /  15360MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|  No running processes found                                                             |
+-----------------------------------------------------------------------------------------+

安装 CUDA

# 卸载旧的CUDA工具包
sudo apt-get purge nvidia-cuda-toolkit
sudo apt-get autoremove
sudo apt-get clean

添加 NVIDIA 官方源

# 添加GPG密钥
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb

# 更新源列表
sudo apt-get update

安装 CUDA Toolkit

# 安装CUDA 13.0(和你的驱动版本匹配)
sudo apt-get install -y cuda-13-0

配置环境变量

# 编辑~/.bashrc文件
vim ~/.bashrc

# 在文件末尾添加以下内容
export PATH=/usr/local/cuda-13.0/bin:$PATH
export LD_LIBRARY_PATH=/usr/local/cuda-13.0/lib64:$LD_LIBRARY_PATH

# 保存并退出后,生效配置
source ~/.bashrc

验证安装

# 检查CUDA版本
nvcc -V

# 预期输出应该包含:
# nvcc: NVIDIA (R) Cuda compiler driver
# Copyright (c) 2005-2024 NVIDIA Corporation
# Built on ...
# Cuda compilation tools, release 13.0, V13.0.xxx

三、安装 NVIDIA Container Toolkit
安装 NVIDIA Container Toolkit,参考[Installing the NVIDIA Container Toolkit](

#中科大源安装

#拉取中科大 GPG 密钥并写入
curl -fsSL https://mirrors.ustc.edu.cn/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg

#配置适配 Ubuntu 22.04 的 nvidia 源列表
# 生成源列表并添加签名验证(适配 jammy 版本)
curl -s -L https://mirrors.ustc.edu.cn/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
    sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
    sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list

# 关键:替换源中的系统版本为 jammy(Ubuntu 22.04),避免源适配错误
sudo sed -i 's/focal/jammy/g' /etc/apt/sources.list.d/nvidia-container-toolkit.list

# 把源列表里的 nvidia.github.io 替换为 mirrors.ustc.edu.cn
sudo sed -i 's#nvidia.github.io/libnvidia-container#mirrors.ustc.edu.cn/libnvidia-container#g' /etc/apt/sources.list.d/nvidia-container-toolkit.list

#更新 apt 缓存
sudo apt update -y

#安装 nvidia-container-toolkit
sudo apt install -y nvidia-container-toolkit

四、安装docker

# 1. 安装依赖
sudo apt install -y apt-transport-https ca-certificates curl gnupg lsb-release

# 2. 配置阿里云yum源
curl -fsSL http://mirrors.aliyun.com/docker-ce/linux/ubuntu/gpg | sudo gpg --dearmor -o /usr/share/keyrings/docker-archive-keyring.gpg

# 3. 修改 Docker 软件源为阿里云
echo \
  "deb [arch=$(dpkg --print-architecture) signed-by=/usr/share/keyrings/docker-archive-keyring.gpg] http://mirrors.aliyun.com/docker-ce/linux/ubuntu \
  $(lsb_release -cs) stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null

# 4. 更新
sudo apt update
# 5. 安装 Docker 最新版本
sudo apt install -y docker-ce docker-ce-cli containerd.io

#验证 Docker 是否安装成功
docker --version



# 3. 配置Docker镜像加速和cgroup驱动、GPU使用
mkdir -p /etc/docker && cat > /etc/docker/daemon.json << 'EOF'
{
  "exec-opts": ["native.cgroupdriver=systemd"],
  "registry-mirrors": [
    "https://mirror.aliyuncs.com",
    "https://hub-mirror.c.163.com",
    "https://docker.m.daocloud.io"
  ],
  "log-driver": "json-file",
  "log-opts": {
    "max-size": "100m"
  },
  "default-runtime": "nvidia",
  "runtimes": {
    "nvidia": {
      "path": "nvidia-container-runtime",
      "runtimeArgs": []
    }
  },
  "storage-driver": "overlay2"
}
EOF


# 4. 启动Docker
systemctl daemon-reload && systemctl start docker && systemctl enable docker

# 5. 配置Docker运行时(如果使用Docker)
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

# 安装指定版本 如20.10.24
sudo apt install -y docker-ce=5:20.10.24~3-0~ubuntu-jammy docker-ce-cli=5:20.10.24~3-0~ubuntu-jammy containerd.io

五、验证docker可以使用GPU

#拉取镜像
docker pull nvidia/cuda:11.8.0-base-ubuntu22.04

#运行
docker run --rm --gpus all nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi


docker pull swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04

#运行
docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi

#一键验证
for host in master node1 node2; do echo -e "\n==================== $host Docker GPU 测试 ===================="; ssh $host "docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi"; done

# 预期输出:容器内能看到GPU信息
root@k8s-master:~# docker run --rm --gpus all swr.cn-north-4.myhuaweicloud.com/ddn-k8s/docker.io/nvidia/cuda:11.8.0-base-ubuntu22.04 nvidia-smi
Thu Jan 22 06:33:02 2026       
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 580.126.09             Driver Version: 580.126.09     CUDA Version: 13.0     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  Tesla T4                       Off |   00000000:00:0A.0 Off |                    0 |
| N/A   42C    P8              9W /   70W |       0MiB /  15360MiB |      0%      Default |
|                                         |                        |                  N/A |
+-----------------------------------------+------------------------+----------------------+

+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|  No running processes found                                                             |
+-----------------------------------------------------------------------------------------+
                                                                                         
+---------------------------------------------------------------------------------------+
| Processes:                                                                            |
|  GPU   GI   CI        PID   Type   Process name                            GPU Memory |
|        ID   ID                                                             Usage      |
|=======================================================================================|
|  No running processes found                                                           |
+---------------------------------------------------------------------------------------+

vLLM安装

一、前置条件与准备

# 验证驱动安装
nvidia-smi  # 应显示GPU信息及CUDA版本兼容性

# 验证CUDA安装
nvcc -V  # 应显示CUDA 12.1版本信息

# 安装基础依赖
sudo apt install -y build-essential gcc g++ cmake git wget curl python3 python3-pip python3-venv

# 配置pip国内镜像(加速安装)
pip3 config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple
pip3 config set global.trusted-host pypi.tuna.tsinghua.edu.cn

二、创建 Python 虚拟环境

# 创建虚拟环境
python3 -m venv vllm-env

# 激活环境
source vllm-env/bin/activate

# 升级pip
pip install --upgrade pip

#注意:机器重启后需要重新激活虚拟环境
source vllm-env/bin/activate

三、安装 vLLM

# 安装vLLM(自动包含PyTorch 2.1+依赖)
pip install vllm  # 最新稳定版,支持Qwen3.5{insert\_element\_0\_}

# 验证安装
python -c "from vllm import LLM; print('vLLM安装成功')"

# 查看vLLM库文件路径
python -c "import vllm; print(vllm.__file__)"

#  (vllm-env) root@ubuntu:~# python -c "import vllm; print(vllm.__file__)"
#  /root/vllm-env/lib/python3.10/site-packages/vllm/__init__.py

可选:从源码编译(支持最新功能)

git clone https://github.com/vllm-project/vllm.git
cd vllm
pip install -e .

四、下载千问 3.5-7B 模型

使用 ModelScope(国内推荐)

# 安装modelscope
pip install modelscope

# 创建 /opt/models/ 目录(-p 表示自动递归创建,不存在就新建)
sudo mkdir -p /opt/models/

# 将文件夹权限赋予当前用户
sudo chown -R $USER:$USER /opt/models/

# 下载模型到文件夹内
modelscope download --model Qwen/Qwen3.5-4B --local_dir /opt/models/Qwen3.5-4B

在这里插入图片描述

五、启动

后续启动 vLLM 时,模型路径必须填这个路径

python -m vllm.entrypoints.openai.api_server \
--model /opt/models/Qwen3.5-4B \
--trust-remote-code \
--dtype float16 \
--port 8000 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.98 \
--max-model-len 4096 \
--enforce-eager





--trust-remote-code  允许加载模型自带的代码,千问模型必须加这个,不加会启动失败!
--dtype float16 指定模型计算精度,使用 16 位浮点数,速度快 + 显存省 + 效果好(T4显卡)
--gpu-memory-utilization 0.98 限制显卡显存使用率,0.98 = 98%
--max-model-len 4096 限制了上下文长度,不然我的显卡会爆显存
--enforce-eager 关闭模型编译,强制使用简单模式



#编译版本启动命令(我的显卡不行)
vllm serve /opt/models/Qwen3.5-4B \
    --host 0.0.0.0 \
    --port 8000 \
    --gpu-memory-utilization 0.95

这个命令是前台启动,测试需要重开两个窗口

窗口1:测试

curl http://10.132.47.60:8000/v1/chat/completions -H "Content-Type: application/json" -d '{
    "model": "/opt/models/Qwen3.5-4B",
    "messages": [{"role": "user", "content": "你好,请介绍一下你自己"}],
    "temperature": 0.7
}'



"model": "/opt/models/Qwen3.5-4B"  :这是模型的路径

窗口2:查看显卡状态

watch nvidia-smi 

在这里插入图片描述

差不多14tokens/s

六、后台启动

nohup python -m vllm.entrypoints.openai.api_server \
--model /opt/models/Qwen3.5-4B \
--trust-remote-code \
--dtype float16 \
--port 8000 \
--host 0.0.0.0 \
--gpu-memory-utilization 0.98 \
--max-model-len 4096 \
--enforce-eager > vllm.log 2>&1 &
  • nohup = 关闭终端也继续运行
  • > vllm.log = 把日志保存到文件里
  • 2>&1 & = 完全丢到后台运行
# 查看是否在运行

ps aux | grep vllm

# 查看日志
tail -f vllm.log

# 停止后台服务
pkill -f "vllm"

up python -m vllm.entrypoints.openai.api_server
–model /opt/models/Qwen3.5-4B
–trust-remote-code
–dtype float16
–port 8000
–host 0.0.0.0
–gpu-memory-utilization 0.98
–max-model-len 4096
–enforce-eager > vllm.log 2>&1 &


- `nohup` = 关闭终端也继续运行
- `> vllm.log` = 把日志保存到文件里
- `2>&1 &` = 完全丢到后台运行



查看是否在运行

ps aux | grep vllm

查看日志

tail -f vllm.log

停止后台服务

pkill -f “vllm”

![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/536ebbd788a448a4a6d36dce723e71d4.png)

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐