spark GB10 多节点vllm跑大模型
https://github.com/eugr/spark-vllm-docker,该网页为面向 DGX Spark 服务器集群 部署 vLLM 大模型推理服务的 Docker 配置项目,专门适配双节点 DGX Spark 硬件环境,提供容器化部署、集群分发、模型补丁等全套能力。
将上述代码仓拷贝到本地即可。
`./spark-vllm-docker/launch-cluster.sh`文件中对DOCKER_ARGS进行修改,增加`-v $MODEL_DIR_HOST:$MODEL_DIR_HOST`,该命令用于对容器挂载相关的卷,主要用于能够在容器内部查看到对应的模型文件。
```
MODEL_DIR_HOST="/home/nvidia"
# Modify these if you want to pass additional docker args or set VLLM_SPARK_EXTRA_DOCKER_ARGS variable
DOCKER_ARGS="-e NCCL_IGNORE_CPU_AFFINITY=1 -v $HF_CACHE_DIR:/root/.cache/huggingface -v $MODEL_DIR_HOST:$MODEL_DIR_HOST"
```
在两台spark GB10上用相同的账户名,在相同路径上都放上同样的模型权重,注意路径和用户名都要相同。
用脚本./launch-cluster.sh按照下述命令启动即可。其中 `-n 169.254.142.30,169.254.170.191` 为两台spark GB10 用QSFP连接的ip,需要改成自己真实的ip。
```
./launch-cluster.sh \
-n 169.254.142.30,169.254.170.191 \
-e NCCL_DEBUG=INFO \
exec vllm serve \
/home/nvidia/qwen3-235B-A22B/qwen3_235b_nvfp4 \
--port 8000 --host 0.0.0.0 \
--gpu-memory-utilization 0.7 \
-tp 2 \
--distributed-executor-backend ray \
--max-model-len 102400 \
--load-format fastsafetensors \
--trust-remote-code
```
上述命令需要下载docker镜像等相关的文件,需要科学上网,如果没有条件,需要将 ./spark-vllm-docker/Dockerfile 文件中部分命令改成如下所述, uv需要从镜像网站下载。
```
RUN apt update && \
apt install -y --no-install-recommends \
curl vim cmake build-essential ninja-build \
libcudnn9-cuda-13 libcudnn9-dev-cuda-13 \
python3-dev python3-pip git wget \
libibverbs1 libibverbs-dev rdma-core \
ccache devscripts debhelper fakeroot \
&& rm -rf /var/lib/apt/lists/* \
&& pip install uv -i https://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn
```
./spark-vllm-docker/build-and-copy.sh 文件中需要将docker 下载的地址改为镜像地址:
如下:



vllm测试大模型的性能,可用下述命令:
```
#!/bin/bash
vllm bench serve \
--host 127.0.0.1 \
--port 8000 \
--backend openai-chat \
--endpoint /v1/chat/completions \
--model /home/nvidia/qwen3-235B-A22B/qwen3_235b_nvfp4 \
--dataset-name random \
--input-len 10240 \
--output-len 5120 \
--num-prompts 10 \
--max-concurrency 1 \
--request-rate inf
```
更多推荐


所有评论(0)