https://github.com/eugr/spark-vllm-docker,该网页为面向 DGX Spark 服务器集群 部署 vLLM 大模型推理服务的 Docker 配置项目,专门适配双节点 DGX Spark 硬件环境,提供容器化部署、集群分发、模型补丁等全套能力。

将上述代码仓拷贝到本地即可。

`./spark-vllm-docker/launch-cluster.sh`文件中对DOCKER_ARGS进行修改,增加`-v $MODEL_DIR_HOST:$MODEL_DIR_HOST`,该命令用于对容器挂载相关的卷,主要用于能够在容器内部查看到对应的模型文件。

```

MODEL_DIR_HOST="/home/nvidia"

# Modify these if you want to pass additional docker args or set VLLM_SPARK_EXTRA_DOCKER_ARGS variable

DOCKER_ARGS="-e NCCL_IGNORE_CPU_AFFINITY=1 -v $HF_CACHE_DIR:/root/.cache/huggingface -v $MODEL_DIR_HOST:$MODEL_DIR_HOST"

```

在两台spark GB10上用相同的账户名,在相同路径上都放上同样的模型权重,注意路径和用户名都要相同。

用脚本./launch-cluster.sh按照下述命令启动即可。其中 `-n 169.254.142.30,169.254.170.191` 为两台spark GB10 用QSFP连接的ip,需要改成自己真实的ip。

```

./launch-cluster.sh \

-n 169.254.142.30,169.254.170.191 \

-e NCCL_DEBUG=INFO \

exec vllm serve \

/home/nvidia/qwen3-235B-A22B/qwen3_235b_nvfp4 \

--port 8000 --host 0.0.0.0 \

--gpu-memory-utilization 0.7 \

-tp 2 \

--distributed-executor-backend ray \

--max-model-len 102400 \

--load-format fastsafetensors \

--trust-remote-code

```

上述命令需要下载docker镜像等相关的文件,需要科学上网,如果没有条件,需要将 ./spark-vllm-docker/Dockerfile 文件中部分命令改成如下所述, uv需要从镜像网站下载。

```

RUN apt update && \

apt install -y --no-install-recommends \

curl vim cmake build-essential ninja-build \

libcudnn9-cuda-13 libcudnn9-dev-cuda-13 \

python3-dev python3-pip git wget \

libibverbs1 libibverbs-dev rdma-core \

ccache devscripts debhelper fakeroot \

&& rm -rf /var/lib/apt/lists/* \

&& pip install uv -i https://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn

```

./spark-vllm-docker/build-and-copy.sh 文件中需要将docker 下载的地址改为镜像地址:

如下:

vllm测试大模型的性能,可用下述命令:

```

#!/bin/bash

vllm bench serve \

--host 127.0.0.1 \

--port 8000 \

--backend openai-chat \

--endpoint /v1/chat/completions \

--model /home/nvidia/qwen3-235B-A22B/qwen3_235b_nvfp4 \

--dataset-name random \

--input-len 10240 \

--output-len 5120 \

--num-prompts 10 \

--max-concurrency 1 \

--request-rate inf

```

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐