视觉推理新标杆:Qwen2.5-VL-72B-Instruct-quantized.w8a8在MMMU数据集上的突破

【免费下载链接】Qwen2.5-VL-72B-Instruct-quantized.w8a8 【免费下载链接】Qwen2.5-VL-72B-Instruct-quantized.w8a8 项目地址: https://ai.gitcode.com/hf_mirrors/nm-testing/Qwen2.5-VL-72B-Instruct-quantized.w8a8

Qwen2.5-VL-72B-Instruct-quantized.w8a8是一款革命性的视觉语言模型,它通过先进的INT8量化技术,在保持高性能的同时显著降低了计算资源需求。这款模型在MMMU(多模态多任务理解)数据集上实现了67.56%的准确率,超越了原始模型的64.33%,展现出惊人的105.02%性能恢复率,为视觉推理领域树立了新的标杆。

什么是Qwen2.5-VL-72B-Instruct-quantized.w8a8?

Qwen2.5-VL-72B-Instruct-quantized.w8a8是由Neural Magic开发的量化版本模型,基于Qwen/Qwen2.5-VL-72B-Instruct构建。它采用了W8A8量化方案,即权重和激活都使用INT8精度,这种优化使得模型在vLLM等推理框架上能够高效运行,同时保持甚至提升原始模型的性能。

核心技术特点

  • 先进量化技术:采用INT8权重和激活量化,在config.json中详细定义了量化配置,包括输入激活的动态量化策略和权重的通道量化策略。
  • 多模态架构:模型架构融合了视觉和语言处理能力,能够同时理解图像和文本输入,输出精准的文本响应。
  • 高效推理:针对vLLM优化,支持快速部署和高吞吐量处理,特别适合实时视觉问答和推理任务。

MMMU数据集上的卓越表现

MMMU数据集是评估多模态模型综合能力的重要基准,涵盖了从科学到人文的多个学科领域。Qwen2.5-VL-72B-Instruct-quantized.w8a8在该数据集上的表现令人瞩目:

模型 MMMU准确率 性能恢复率
Qwen/Qwen2.5-VL-72B-Instruct 64.33% -
Qwen2.5-VL-72B-Instruct-quantized.w8a8 67.56% 105.02%

这一结果不仅证明了量化模型在保持性能方面的能力,更展示了Neural Magic量化技术的优越性。值得注意的是,这一突破并非偶然,模型在其他视觉任务中也表现出色:

  • VQAv2:81.91%准确率(原始模型81.94%)
  • DocVQA:94.71% ANLS分数(与原始模型持平)
  • ChartQA:89.40%准确率(原始模型88.96%)
  • MathVista:78.38%准确率(原始模型78.18%)

平均下来,量化模型在视觉任务上的表现比原始模型高出0.46个百分点,达到了100.46%的平均性能恢复率。

性能与效率的完美平衡

除了出色的准确率,Qwen2.5-VL-72B-Instruct-quantized.w8a8还在推理性能和成本效益方面带来了显著提升。

单流部署性能

在A100 GPU上,量化模型只需2块GPU即可达到原始模型4块GPU的性能,同时实现1.85倍的成本降低:

硬件 模型 文档视觉问答延迟 视觉推理延迟 图像 captioning延迟
A100x4 原始模型 6.4秒 4.5秒 4.4秒
A100x2 量化模型 7.0秒 4.9秒 4.8秒

多流异步性能

在多用户并发场景下,量化模型的优势更加明显,在A100x4配置上实现了1.80倍的平均成本降低:

模型 文档视觉问答QPS 视觉推理QPS 图像 captioning QPS
原始模型 0.4 1.1 1.2
量化模型 0.6 2.0 2.3

这些性能提升意味着用户可以用更少的硬件资源处理更多的请求,大幅降低部署成本。

快速开始使用

要开始使用Qwen2.5-VL-72B-Instruct-quantized.w8a8,只需按照以下简单步骤操作:

1. 克隆仓库

git clone https://gitcode.com/hf_mirrors/nm-testing/Qwen2.5-VL-72B-Instruct-quantized.w8a8

2. 使用vLLM部署

from vllm.assets.image import ImageAsset
from vllm import LLM, SamplingParams

# 准备模型
llm = LLM(
    model="neuralmagic/Qwen2.5-VL-72B-Instruct-quantized.w8a8",
    trust_remote_code=True,
    max_model_len=4096,
    max_num_seqs=2,
)

# 准备输入
question = "What is the content of this image?"
inputs = {
    "prompt": f"<|user|>\n<|image_1|>\n{question}<|end|>\n<|assistant|>\n",
    "multi_modal_data": {
        "image": ImageAsset("cherry_blossom").pil_image.convert("RGB")
    },
}

# 生成响应
outputs = llm.generate(inputs, SamplingParams(temperature=0.2, max_tokens=64))
print(f"RESPONSE: {outputs[0].outputs[0].text}")

3. 调整生成参数

你可以通过修改generation_config.json来调整模型的生成参数,如temperature、repetition_penalty等,以获得最佳结果。默认配置为:

{
  "bos_token_id": 151643,
  "pad_token_id": 151643,
  "do_sample": true,
  "eos_token_id": [151645, 151643],
  "repetition_penalty": 1.05,
  "temperature": 0.000001
}

结论

Qwen2.5-VL-72B-Instruct-quantized.w8a8通过创新的量化技术,在保持甚至提升模型性能的同时,显著降低了计算资源需求。其在MMMU数据集上的突破性表现,证明了量化模型在复杂视觉推理任务中的巨大潜力。无论是学术研究还是商业应用,这款模型都为开发者提供了一个高性能、高效率的多模态AI解决方案。

随着AI技术的不断发展,我们有理由相信,Qwen2.5-VL-72B-Instruct-quantized.w8a8将在医疗影像分析、智能教育、自动驾驶等领域发挥重要作用,为各行各业带来革命性的变化。现在就开始探索这款令人惊叹的模型,开启你的AI视觉推理之旅吧!

【免费下载链接】Qwen2.5-VL-72B-Instruct-quantized.w8a8 【免费下载链接】Qwen2.5-VL-72B-Instruct-quantized.w8a8 项目地址: https://ai.gitcode.com/hf_mirrors/nm-testing/Qwen2.5-VL-72B-Instruct-quantized.w8a8

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐