视觉推理新标杆:Qwen2.5-VL-72B-Instruct-quantized.w8a8在MMMU数据集上的突破
视觉推理新标杆:Qwen2.5-VL-72B-Instruct-quantized.w8a8在MMMU数据集上的突破
Qwen2.5-VL-72B-Instruct-quantized.w8a8是一款革命性的视觉语言模型,它通过先进的INT8量化技术,在保持高性能的同时显著降低了计算资源需求。这款模型在MMMU(多模态多任务理解)数据集上实现了67.56%的准确率,超越了原始模型的64.33%,展现出惊人的105.02%性能恢复率,为视觉推理领域树立了新的标杆。
什么是Qwen2.5-VL-72B-Instruct-quantized.w8a8?
Qwen2.5-VL-72B-Instruct-quantized.w8a8是由Neural Magic开发的量化版本模型,基于Qwen/Qwen2.5-VL-72B-Instruct构建。它采用了W8A8量化方案,即权重和激活都使用INT8精度,这种优化使得模型在vLLM等推理框架上能够高效运行,同时保持甚至提升原始模型的性能。
核心技术特点
- 先进量化技术:采用INT8权重和激活量化,在config.json中详细定义了量化配置,包括输入激活的动态量化策略和权重的通道量化策略。
- 多模态架构:模型架构融合了视觉和语言处理能力,能够同时理解图像和文本输入,输出精准的文本响应。
- 高效推理:针对vLLM优化,支持快速部署和高吞吐量处理,特别适合实时视觉问答和推理任务。
MMMU数据集上的卓越表现
MMMU数据集是评估多模态模型综合能力的重要基准,涵盖了从科学到人文的多个学科领域。Qwen2.5-VL-72B-Instruct-quantized.w8a8在该数据集上的表现令人瞩目:
| 模型 | MMMU准确率 | 性能恢复率 |
|---|---|---|
| Qwen/Qwen2.5-VL-72B-Instruct | 64.33% | - |
| Qwen2.5-VL-72B-Instruct-quantized.w8a8 | 67.56% | 105.02% |
这一结果不仅证明了量化模型在保持性能方面的能力,更展示了Neural Magic量化技术的优越性。值得注意的是,这一突破并非偶然,模型在其他视觉任务中也表现出色:
- VQAv2:81.91%准确率(原始模型81.94%)
- DocVQA:94.71% ANLS分数(与原始模型持平)
- ChartQA:89.40%准确率(原始模型88.96%)
- MathVista:78.38%准确率(原始模型78.18%)
平均下来,量化模型在视觉任务上的表现比原始模型高出0.46个百分点,达到了100.46%的平均性能恢复率。
性能与效率的完美平衡
除了出色的准确率,Qwen2.5-VL-72B-Instruct-quantized.w8a8还在推理性能和成本效益方面带来了显著提升。
单流部署性能
在A100 GPU上,量化模型只需2块GPU即可达到原始模型4块GPU的性能,同时实现1.85倍的成本降低:
| 硬件 | 模型 | 文档视觉问答延迟 | 视觉推理延迟 | 图像 captioning延迟 |
|---|---|---|---|---|
| A100x4 | 原始模型 | 6.4秒 | 4.5秒 | 4.4秒 |
| A100x2 | 量化模型 | 7.0秒 | 4.9秒 | 4.8秒 |
多流异步性能
在多用户并发场景下,量化模型的优势更加明显,在A100x4配置上实现了1.80倍的平均成本降低:
| 模型 | 文档视觉问答QPS | 视觉推理QPS | 图像 captioning QPS |
|---|---|---|---|
| 原始模型 | 0.4 | 1.1 | 1.2 |
| 量化模型 | 0.6 | 2.0 | 2.3 |
这些性能提升意味着用户可以用更少的硬件资源处理更多的请求,大幅降低部署成本。
快速开始使用
要开始使用Qwen2.5-VL-72B-Instruct-quantized.w8a8,只需按照以下简单步骤操作:
1. 克隆仓库
git clone https://gitcode.com/hf_mirrors/nm-testing/Qwen2.5-VL-72B-Instruct-quantized.w8a8
2. 使用vLLM部署
from vllm.assets.image import ImageAsset
from vllm import LLM, SamplingParams
# 准备模型
llm = LLM(
model="neuralmagic/Qwen2.5-VL-72B-Instruct-quantized.w8a8",
trust_remote_code=True,
max_model_len=4096,
max_num_seqs=2,
)
# 准备输入
question = "What is the content of this image?"
inputs = {
"prompt": f"<|user|>\n<|image_1|>\n{question}<|end|>\n<|assistant|>\n",
"multi_modal_data": {
"image": ImageAsset("cherry_blossom").pil_image.convert("RGB")
},
}
# 生成响应
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))
print(f"RESPONSE: {outputs[0].outputs[0].text}")
3. 调整生成参数
你可以通过修改generation_config.json来调整模型的生成参数,如temperature、repetition_penalty等,以获得最佳结果。默认配置为:
{
"bos_token_id": 151643,
"pad_token_id": 151643,
"do_sample": true,
"eos_token_id": [151645, 151643],
"repetition_penalty": 1.05,
"temperature": 0.000001
}
结论
Qwen2.5-VL-72B-Instruct-quantized.w8a8通过创新的量化技术,在保持甚至提升模型性能的同时,显著降低了计算资源需求。其在MMMU数据集上的突破性表现,证明了量化模型在复杂视觉推理任务中的巨大潜力。无论是学术研究还是商业应用,这款模型都为开发者提供了一个高性能、高效率的多模态AI解决方案。
随着AI技术的不断发展,我们有理由相信,Qwen2.5-VL-72B-Instruct-quantized.w8a8将在医疗影像分析、智能教育、自动驾驶等领域发挥重要作用,为各行各业带来革命性的变化。现在就开始探索这款令人惊叹的模型,开启你的AI视觉推理之旅吧!
更多推荐


所有评论(0)