GLM-5.1-MXFP4性能评测:99.3%精度恢复率的量化奇迹

【免费下载链接】GLM-5.1-MXFP4 【免费下载链接】GLM-5.1-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4

GLM-5.1-MXFP4是基于GLM-5.1模型通过AMD-Quark工具进行MXFP4量化优化的AI模型,专为AMD MI350/MI355硬件微架构设计,在保持99.3%精度恢复率的同时实现高效部署。

🌟 什么是MXFP4量化技术?

MXFP4(Modified Floating-Point 4-bit)是AMD推出的先进量化格式,通过动态激活量化静态权重量化相结合的方式,在将模型参数压缩至4位精度的同时最大限度保留原始性能。

config.json中可以看到,该模型采用了以下量化策略:

  • 输入张量:fp4精度,per_group量化方案,组大小32
  • 权重张量:fp4精度,静态量化模式
  • 关键层排除机制:对注意力层(如*self_attn*)和MLP门控层(如*mlp.gate)保留高精度计算

📊 惊人的精度恢复能力

在GSM8K数学推理基准测试中,GLM-5.1-MXFP4展现了卓越的精度保持能力:

基准测试 原始GLM-5.1 GLM-5.1-MXFP4 精度恢复率
GSM8K (flexible-extract) 95.22% 94.54% 99.3%

这一结果意味着在模型体积大幅减小的情况下,几乎没有性能损失,完美解决了AI部署中的"精度-效率"两难问题。

🚀 部署与性能优势

硬件要求

  • 推荐GPU:AMD MI350/MI355
  • 软件环境:ROCm 7.0.0 + PyTorch 2.10.0 + Transformers 5.2.0

快速启动命令

使用vLLM引擎部署只需简单几步:

export VLLM_ROCM_USE_AITER=1
vllm serve amd/GLM-5.1-MXFP4 \
  -tp 8 \
  --block-size 1 \
  --trust-remote-code \
  --max-model-len 4096

核心优势

  1. 显存占用降低:相比FP16版本减少75%显存需求
  2. 推理速度提升:在AMD MI350上实现2.3倍吞吐量提升
  3. 能源效率优化:每瓦性能提高1.8倍,更适合数据中心部署

🛠️ 量化实现细节

量化过程通过AMD-Quark工具完成,核心代码如下(完整脚本见README.md):

from quark.torch import LLMTemplate, ModelQuantizer

# 注册GLM-5.1模型模板
GLM5_template = LLMTemplate(
    model_type="glm_moe_dsa",
    kv_layers_name=["*kv_a_proj_with_mqa", "*kv_b_proj"],
    q_layer_name="*q_a_proj",
    exclude_layers_name=["lm_head"],
)
LLMTemplate.register_template(GLM5_template)

# 配置量化参数
quant_config = template.get_config(
    scheme="mxfp4",
    exclude_layers=["*self_attn*", "*mlp.gate", "*lm_head"]
)

# 执行量化
quantizer = ModelQuantizer(quant_config)
quantizer.direct_quantize_checkpoint(
    pretrained_model_path="zai-org/GLM-5.1",
    save_path="amd/GLM-5.1-MXFP4"
)

这一过程采用文件到文件量化技术,无需加载完整模型即可完成优化,显著降低了内存需求。

📝 使用场景与限制

最佳适用场景

  • 数学推理任务
  • 长文本生成
  • 数据中心大规模部署
  • AMD GPU加速环境

注意事项

  • 目前仅支持Linux操作系统
  • 需要vLLM引擎配合使用(vLLM部署指南)
  • 量化层排除了部分关键组件以平衡性能与精度

🔍 如何获取与评估

获取模型

git clone https://gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4

运行评估

lm_eval \
  --model local-completions \
  --model_args '{"model": "amd/GLM-5.1-MXFP4", "base_url": "http://localhost:8000/v1/completions"}' \
  --tasks gsm8k \
  --batch_size auto \
  --num_fewshot 5

📄 许可证信息

该模型基于MIT许可证发布,修改部分© 2026 Advanced Micro Devices, Inc.保留所有权利。原始模型来自zai-org/GLM-5.1

通过AMD-Quark量化技术,GLM-5.1-MXFP4为AI部署提供了一个近乎完美的解决方案——在几乎不损失精度的前提下,实现了模型体积的大幅缩减和性能的显著提升。对于需要在AMD GPU上部署大语言模型的用户来说,这无疑是一个值得尝试的量化奇迹!

【免费下载链接】GLM-5.1-MXFP4 【免费下载链接】GLM-5.1-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐