Mellum2-12B-A2.5B-Thinking vs Qwen3.5:8大基准测试数据对比与优势分析

【免费下载链接】Mellum2-12B-A2.5B-Thinking 【免费下载链接】Mellum2-12B-A2.5B-Thinking 项目地址: https://ai.gitcode.com/hf_mirrors/JetBrains/Mellum2-12B-A2.5B-Thinking

Mellum2-12B-A2.5B-Thinking是JetBrains开发的推理增强型AI助手模型,采用混合专家(Mixture-of-Experts)架构,具备131,072 tokens的超长上下文能力,特别擅长复杂调试、多步骤规划和数学推理任务。本文将通过8大核心基准测试,全面对比Mellum2-12B-A2.5B-Thinking与Qwen3.5(4B/9B)模型的性能差异,为开发者选择合适的AI模型提供权威参考。

核心性能对比概览

Mellum2-12B-A2.5B-Thinking在多个关键评测维度展现出独特优势,尤其在代码生成、工具调用和安全合规性方面表现突出。以下是JetBrains官方发布的核心基准测试数据对比(所有数值均为百分比,HarmBench越低越好):

评测类别 基准测试 Mellum2 Thinking Qwen3.5 (4B) Qwen3.5 (9B)
代码能力 LiveCodeBench v6 69.9 59.4 68.3
工具使用 BFCL v4 45.6 42.9 42.7
数学推理 GSM-Plus 87.0 89.3 90.7
知识掌握 MMLU-Redux 86.2 88.3 91.7
对话能力 JetBrains pairwise 69.5 40.5 56.7
安全合规 XSTest 89.6 96.8 97.6
安全风险 HarmBench (↓) 20.6 15.9 6.6
综合评测 MixEval 66.9 71.9 76.0

1. 代码生成能力:LiveCodeBench v6

在代码生成领域,Mellum2-12B-A2.5B-Thinking以69.9%的通过率领先Qwen3.5-4B(59.4%),略高于Qwen3.5-9B(68.3%)。这一优势得益于其专为开发者优化的推理架构,能够处理复杂的代码逻辑和调试任务。

提示:Mellum2系列提供专用的Instruct模型,适合需要低延迟直接答案的场景。

2. 工具调用能力:BFCL v4

在工具调用评测中,Mellum2-Thinking以45.6%的准确率显著优于Qwen3.5的两个版本(42.9%/42.7%)。该模型支持自动工具选择功能,可通过vLLM部署启用:

# 启用工具调用的部署命令
vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking \
  --max-model-len 131072 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes

3. 数学推理能力:GSM-Plus与AIME

Mellum2-Thinking在GSM-Plus测试中获得87.0%的准确率,虽然略低于Qwen3.5(89.3%/90.7%),但在更具挑战性的AIME数学竞赛中展现出独特优势——通过其特有的</think>...</think>推理块机制,能够处理多步骤数学问题,尤其适合需要详细推导过程的场景。

4. 对话能力:JetBrains pairwise测试

在与Qwen2.5-7B-Instruct的直接对比中,Mellum2-Thinking以69.5%的胜率大幅领先Qwen3.5-4B(40.5%)和Qwen3.5-9B(56.7%),证明其在复杂对话场景中的卓越表现。该模型的131,072 tokens超长上下文能力,使其能够处理长对话历史和复杂指令。

5. 安全合规性:XSTest与HarmBench

安全评测呈现两极分化:Mellum2-Thinking在XSTest安全合规性测试中获得89.6%的分数,虽低于Qwen3.5(96.8%/97.6%),但在HarmBench有害内容生成测试中(20.6%)显著优于Ministral 3(70.0%),表明其在安全性与可用性之间取得了平衡。

模型部署与快速开始

环境要求

  • Python 3.8+
  • vLLM 0.4.0+
  • Transformers 4.36.0+

快速部署命令

# 基础部署(无工具调用)
vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking \
  --max-model-len 131072 \
  --reasoning-parser qwen3

Python API调用示例

from openai import OpenAI
client = OpenAI()

messages = [
    {"role": "user", "content": "Is 1024 a power of 2? Explain your reasoning."},
]

chat_response = client.chat.completions.create(
    model="JetBrains/Mellum2-12B-A2.5B-Thinking",
    messages=messages,
    max_tokens=81920,
    temperature=0.6,
    top_p=0.95
)
print("Chat response:", chat_response)

结论:如何选择适合你的模型?

  • 优先选择Mellum2-Thinking:如果你需要处理复杂代码调试、多步骤推理任务,或需要超长上下文支持。
  • 考虑Qwen3.5-9B:如果你的应用更注重知识问答和安全合规性,且可以接受较高的计算资源需求。
  • 选择Qwen3.5-4B:若你需要在资源受限环境中部署,且对性能要求不高。

所有测试数据均来自JetBrains官方发布,完整技术细节可参考Mellum2 Technical Report。模型开源协议为Apache 2.0,可免费用于商业和非商业用途。

要开始使用Mellum2-12B-A2.5B-Thinking,请克隆仓库:

git clone https://gitcode.com/hf_mirrors/JetBrains/Mellum2-12B-A2.5B-Thinking

【免费下载链接】Mellum2-12B-A2.5B-Thinking 【免费下载链接】Mellum2-12B-A2.5B-Thinking 项目地址: https://ai.gitcode.com/hf_mirrors/JetBrains/Mellum2-12B-A2.5B-Thinking

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐