vLLM框架部署Qwen3.5-35B-A3B-MXFP4教程:支持262K上下文的高性能推理方案
·
vLLM框架部署Qwen3.5-35B-A3B-MXFP4教程:支持262K上下文的高性能推理方案
【免费下载链接】Qwen3.5-35B-A3B-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4
Qwen3.5-35B-A3B-MXFP4是基于AMD MI300系列GPU优化的高性能大语言模型,采用MXFP4量化技术实现高效推理,同时支持长达262K(262144 tokens)的超长上下文处理能力。本教程将详细介绍如何使用vLLM框架快速部署该模型,让新手用户也能轻松搭建企业级AI推理服务。
📋 环境准备与依赖安装
系统要求
- 操作系统:Linux(推荐Ubuntu 22.04+)
- 硬件要求:AMD MI300/MI350/MI355 GPU(至少4张)
- 软件依赖:
- ROCm 7.0.0
- PyTorch 2.9.1
- Transformers 5.3.0
- vLLM 0.16.0rc2
一键安装vLLM
# 创建虚拟环境
python -m venv vllm_env
source vllm_env/bin/activate
# 安装ROCm版本vLLM
pip install vllm==0.16.0rc2 --extra-index-url https://download.pytorch.org/whl/rocm7.0
🚀 模型获取与部署步骤
克隆模型仓库
git clone https://gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4
cd Qwen3.5-35B-A3B-MXFP4
启动vLLM推理服务
使用以下命令启动支持262K上下文的API服务:
python -m vllm.entrypoints.api_server \
--model ./ \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--gpu-memory-utilization 0.90 \
--trust-remote-code \
--quantization mxfp4
参数说明:
--tensor-parallel-size 4:指定4张GPU进行张量并行--max-model-len 262144:设置最大上下文长度为262K tokens--gpu-memory-utilization 0.90:GPU内存利用率控制在90%--quantization mxfp4:启用MXFP4量化加速
🔍 性能验证与使用示例
测试超长文本处理能力
通过API调用验证模型的长上下文理解能力:
import requests
prompt = "请总结以下技术文档内容:" + "(此处省略200K tokens的长文本)"
response = requests.post(
"http://localhost:8000/generate",
json={
"prompt": prompt,
"max_tokens": 2048,
"temperature": 0.7
}
)
print(response.json()["text"])
评估性能指标
根据官方测试数据,该模型在GSM8K数学推理任务中表现优异:
| 基准测试 | FP8版本准确率 | MXFP4量化版本准确率 | 性能恢复率 |
|---|---|---|---|
| gsm8k (flexible-extract) | 89.39% | 93.25% | 104.32% |
⚙️ 高级配置与优化
修改推理参数
通过修改generation_config.json调整默认推理行为:
max_new_tokens:控制生成文本长度temperature:调节输出随机性(0.0-1.0)top_p: nucleus采样参数
使用AMD-Quark优化
该模型已通过AMD-Quark工具链进行MXFP4量化优化,量化脚本参考:
cd Quark/examples/torch/language_modeling/llm_ptq/
export exclude_layers="lm_head model.visual.* mtp.* *mlp.gate *shared_expert_gate* *.linear_attn.* *.self_attn.* *.shared_expert.*"
python3 quantize_quark.py --model_dir Qwen/Qwen3.5-35B-A3B-FP8 \
--quant_scheme mxfp4 \
--file2file_quantization \
--exclude_layers $exclude_layers \
--output_dir amd/Qwen3.5-35B-A3B-MXFP4
❓ 常见问题解决
内存不足错误
- 减少
gpu_memory_utilization参数值(如0.85) - 增加张量并行数量(需更多GPU)
推理速度慢
- 确保使用最新版ROCm驱动
- 检查GPU温度是否过高(建议低于85°C)
📄 许可证信息
本模型基于Apache-2.0许可证发布,详细条款参见项目根目录下的LICENSE文件。修改部分版权归Advanced Micro Devices, Inc.所有。
【免费下载链接】Qwen3.5-35B-A3B-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4
更多推荐


所有评论(0)