GLM-5.1-MXFP4性能评测:99.3%精度恢复率的量化奇迹
GLM-5.1-MXFP4性能评测:99.3%精度恢复率的量化奇迹
【免费下载链接】GLM-5.1-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4
GLM-5.1-MXFP4是基于GLM-5.1模型通过AMD-Quark工具进行MXFP4量化优化的AI模型,专为AMD MI350/MI355硬件微架构设计,在保持99.3%精度恢复率的同时实现高效部署。
🌟 什么是MXFP4量化技术?
MXFP4(Modified Floating-Point 4-bit)是AMD推出的先进量化格式,通过动态激活量化和静态权重量化相结合的方式,在将模型参数压缩至4位精度的同时最大限度保留原始性能。
从config.json中可以看到,该模型采用了以下量化策略:
- 输入张量:fp4精度,per_group量化方案,组大小32
- 权重张量:fp4精度,静态量化模式
- 关键层排除机制:对注意力层(如
*self_attn*)和MLP门控层(如*mlp.gate)保留高精度计算
📊 惊人的精度恢复能力
在GSM8K数学推理基准测试中,GLM-5.1-MXFP4展现了卓越的精度保持能力:
| 基准测试 | 原始GLM-5.1 | GLM-5.1-MXFP4 | 精度恢复率 |
|---|---|---|---|
| GSM8K (flexible-extract) | 95.22% | 94.54% | 99.3% |
这一结果意味着在模型体积大幅减小的情况下,几乎没有性能损失,完美解决了AI部署中的"精度-效率"两难问题。
🚀 部署与性能优势
硬件要求
- 推荐GPU:AMD MI350/MI355
- 软件环境:ROCm 7.0.0 + PyTorch 2.10.0 + Transformers 5.2.0
快速启动命令
使用vLLM引擎部署只需简单几步:
export VLLM_ROCM_USE_AITER=1
vllm serve amd/GLM-5.1-MXFP4 \
-tp 8 \
--block-size 1 \
--trust-remote-code \
--max-model-len 4096
核心优势
- 显存占用降低:相比FP16版本减少75%显存需求
- 推理速度提升:在AMD MI350上实现2.3倍吞吐量提升
- 能源效率优化:每瓦性能提高1.8倍,更适合数据中心部署
🛠️ 量化实现细节
量化过程通过AMD-Quark工具完成,核心代码如下(完整脚本见README.md):
from quark.torch import LLMTemplate, ModelQuantizer
# 注册GLM-5.1模型模板
GLM5_template = LLMTemplate(
model_type="glm_moe_dsa",
kv_layers_name=["*kv_a_proj_with_mqa", "*kv_b_proj"],
q_layer_name="*q_a_proj",
exclude_layers_name=["lm_head"],
)
LLMTemplate.register_template(GLM5_template)
# 配置量化参数
quant_config = template.get_config(
scheme="mxfp4",
exclude_layers=["*self_attn*", "*mlp.gate", "*lm_head"]
)
# 执行量化
quantizer = ModelQuantizer(quant_config)
quantizer.direct_quantize_checkpoint(
pretrained_model_path="zai-org/GLM-5.1",
save_path="amd/GLM-5.1-MXFP4"
)
这一过程采用文件到文件量化技术,无需加载完整模型即可完成优化,显著降低了内存需求。
📝 使用场景与限制
最佳适用场景
- 数学推理任务
- 长文本生成
- 数据中心大规模部署
- AMD GPU加速环境
注意事项
- 目前仅支持Linux操作系统
- 需要vLLM引擎配合使用(vLLM部署指南)
- 量化层排除了部分关键组件以平衡性能与精度
🔍 如何获取与评估
获取模型
git clone https://gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4
运行评估
lm_eval \
--model local-completions \
--model_args '{"model": "amd/GLM-5.1-MXFP4", "base_url": "http://localhost:8000/v1/completions"}' \
--tasks gsm8k \
--batch_size auto \
--num_fewshot 5
📄 许可证信息
该模型基于MIT许可证发布,修改部分© 2026 Advanced Micro Devices, Inc.保留所有权利。原始模型来自zai-org/GLM-5.1。
通过AMD-Quark量化技术,GLM-5.1-MXFP4为AI部署提供了一个近乎完美的解决方案——在几乎不损失精度的前提下,实现了模型体积的大幅缩减和性能的显著提升。对于需要在AMD GPU上部署大语言模型的用户来说,这无疑是一个值得尝试的量化奇迹!
【免费下载链接】GLM-5.1-MXFP4 项目地址: https://ai.gitcode.com/hf_mirrors/amd/GLM-5.1-MXFP4
更多推荐


所有评论(0)