vLLM框架部署Qwen3.5-35B-A3B-MXFP4教程:支持262K上下文的高性能推理方案

【免费下载链接】Qwen3.5-35B-A3B-MXFP4 【免费下载链接】Qwen3.5-35B-A3B-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4

Qwen3.5-35B-A3B-MXFP4是基于AMD MI300系列GPU优化的高性能大语言模型,采用MXFP4量化技术实现高效推理,同时支持长达262K(262144 tokens)的超长上下文处理能力。本教程将详细介绍如何使用vLLM框架快速部署该模型,让新手用户也能轻松搭建企业级AI推理服务。

📋 环境准备与依赖安装

系统要求

  • 操作系统:Linux(推荐Ubuntu 22.04+)
  • 硬件要求:AMD MI300/MI350/MI355 GPU(至少4张)
  • 软件依赖
    • ROCm 7.0.0
    • PyTorch 2.9.1
    • Transformers 5.3.0
    • vLLM 0.16.0rc2

一键安装vLLM

# 创建虚拟环境
python -m venv vllm_env
source vllm_env/bin/activate

# 安装ROCm版本vLLM
pip install vllm==0.16.0rc2 --extra-index-url https://download.pytorch.org/whl/rocm7.0

🚀 模型获取与部署步骤

克隆模型仓库

git clone https://gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4
cd Qwen3.5-35B-A3B-MXFP4

启动vLLM推理服务

使用以下命令启动支持262K上下文的API服务:

python -m vllm.entrypoints.api_server \
  --model ./ \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --gpu-memory-utilization 0.90 \
  --trust-remote-code \
  --quantization mxfp4

参数说明:

  • --tensor-parallel-size 4:指定4张GPU进行张量并行
  • --max-model-len 262144:设置最大上下文长度为262K tokens
  • --gpu-memory-utilization 0.90:GPU内存利用率控制在90%
  • --quantization mxfp4:启用MXFP4量化加速

🔍 性能验证与使用示例

测试超长文本处理能力

通过API调用验证模型的长上下文理解能力:

import requests

prompt = "请总结以下技术文档内容:" + "(此处省略200K tokens的长文本)"

response = requests.post(
  "http://localhost:8000/generate",
  json={
    "prompt": prompt,
    "max_tokens": 2048,
    "temperature": 0.7
  }
)

print(response.json()["text"])

评估性能指标

根据官方测试数据,该模型在GSM8K数学推理任务中表现优异:

基准测试 FP8版本准确率 MXFP4量化版本准确率 性能恢复率
gsm8k (flexible-extract) 89.39% 93.25% 104.32%

⚙️ 高级配置与优化

修改推理参数

通过修改generation_config.json调整默认推理行为:

  • max_new_tokens:控制生成文本长度
  • temperature:调节输出随机性(0.0-1.0)
  • top_p: nucleus采样参数

使用AMD-Quark优化

该模型已通过AMD-Quark工具链进行MXFP4量化优化,量化脚本参考:

cd Quark/examples/torch/language_modeling/llm_ptq/
export exclude_layers="lm_head model.visual.* mtp.* *mlp.gate *shared_expert_gate* *.linear_attn.* *.self_attn.* *.shared_expert.*"
python3 quantize_quark.py --model_dir Qwen/Qwen3.5-35B-A3B-FP8 \
                          --quant_scheme mxfp4 \
                          --file2file_quantization \
                          --exclude_layers $exclude_layers \
                          --output_dir amd/Qwen3.5-35B-A3B-MXFP4

❓ 常见问题解决

内存不足错误

  • 减少gpu_memory_utilization参数值(如0.85)
  • 增加张量并行数量(需更多GPU)

推理速度慢

  • 确保使用最新版ROCm驱动
  • 检查GPU温度是否过高(建议低于85°C)

📄 许可证信息

本模型基于Apache-2.0许可证发布,详细条款参见项目根目录下的LICENSE文件。修改部分版权归Advanced Micro Devices, Inc.所有。

【免费下载链接】Qwen3.5-35B-A3B-MXFP4 【免费下载链接】Qwen3.5-35B-A3B-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-35B-A3B-MXFP4

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐