解密Qwen3.6-35B-A3B-APEX-MTP-GGUF:APEX量化技术如何让MoE模型性能提升30%
解密Qwen3.6-35B-A3B-APEX-MTP-GGUF:APEX量化技术如何让MoE模型性能提升30%
Qwen3.6-35B-A3B-APEX-MTP-GGUF是基于Qwen/Qwen3.6-35B-A3B模型的APEX(Adaptive Precision for EXpert Models)量化版本,它将MTP(multi-token prediction)头与主干模型捆绑在单个文件中,借助llama.cpp的支持实现自推测解码,为用户带来高效的本地部署体验。
APEX量化技术:MoE模型的性能加速器 🚀
APEX是一种MoE感知的混合精度量化策略,其核心在于针对模型不同部分采用差异化的量化方案。对于路由专家(routed experts),APEX会进行最大程度的压缩;而对于共享专家(shared experts),则保持较高精度以确保其在模型运行时的稳定表现;注意力机制和Mamba部分则采用统一的量化处理。这种精细化的量化策略使得模型在大幅减小体积的同时,仍能保持出色的性能。
APEX量化技术通过5+5对称边缘梯度,在40个主干层和MTP第40层采用边缘精度,实现了模型精度与性能的平衡。I变体还使用多样化的imatrix校准数据,涵盖聊天、代码、推理、工具调用、代理轨迹和维基百科等多个领域,进一步提升了模型在不同场景下的适应性。
MTP头:自推测解码的秘密武器 💡
MTP(multi-token prediction)头是Qwen3.6-35B-A3B-APEX-MTP-GGUF的一大特色。这些GGUF文件将模型的MTP头与主干模型捆绑在单个文件中,这得益于llama.cpp PR #22673。使用较新版本的llama.cpp(>= commit 255582687),用户只需这一个文件就能启用自推测解码,无需单独的草稿模型:
llama-server -m Qwen3.6-35B-A3B-APEX-MTP-I-Balanced.gguf --draft-mtp
捆绑的MTP头(包括nextn.*投影和规范的blk.40.*)在除I-Nano之外的每个层级都被量化为Q8_0(接近无损)。I-Nano在MTP块上保持主干层精度(Q3_K路由专家,Q4_K注意力),但将blk.40.nextn.eh_proj固定为Q4_K。这种设计在保证草稿准确性(对推测解码接受率至关重要)的同时,相较于主干层精度仅增加了约1GB的成本。
模型架构与文件信息 📊
架构详情
- 基础模型:Qwen 3.6 35B-A3B系列(Qwen3_5MoeForCausalLM)
- 层数:40个主干层 + 1个MTP层(已捆绑)
- 专家数量:256个路由专家 + 1个共享专家(每个令牌激活8个)
- 隐藏层大小:2048
- 校准数据:v1.3多样化数据集
文件特点
每个量化文件比其非MTP对应版本大约2.5%,这是因为包含了一个额外的transformer块权重,由于MTP共享主干的embed_tokens,所以没有嵌入重复。
快速上手:体验性能提升 🏃♂️
要开始使用Qwen3.6-35B-A3B-APEX-MTP-GGUF,首先需要克隆仓库:
git clone https://gitcode.com/hf_mirrors/mudler/Qwen3.6-35B-A3B-APEX-MTP-GGUF
然后使用llama.cpp运行模型,以启用自推测解码:
llama-server -m Qwen3.6-35B-A3B-APEX-MTP-I-Balanced.gguf --draft-mtp
通过这种方式,你可以充分体验APEX量化技术为MoE模型带来的性能提升,享受高效的本地AI服务。
总结
Qwen3.6-35B-A3B-APEX-MTP-GGUF凭借APEX量化技术和MTP头的创新结合,为MoE模型的本地部署开辟了新的可能。其在性能和效率上的优化,使得更多用户能够便捷地使用强大的AI模型。如果你觉得APEX量化模型对你有帮助,欢迎通过Patreon、Buy Me a Coffee或GitHub Sponsors等方式支持开发者,以资助更大规模的模型量化工作。
APEX项目的更多详细信息可参考APEX Project,技术报告可查阅Technical Report。非MTP版本可在mudler/Qwen3.6-35B-A3B-APEX-GGUF获取,该版本体积稍小,但不支持自推测解码。
更多推荐



所有评论(0)