Ling-3.0-tiny性能评测:25分AAI指数与16分Agentic指数背后的技术密码

【免费下载链接】Ling-3.0-tiny 【免费下载链接】Ling-3.0-tiny 项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny

Ling-3.0-tiny是一款轻量级混合推理MoE模型,拥有7.9B总参数和仅1.3B每token激活参数,专为在低推理成本下提供强大的推理和智能体能力而设计,使高级模型功能更易于在本地和资源受限环境中部署。

🌟 核心架构解析:效率与性能的完美平衡

混合线性注意力架构

Ling-3.0-tiny采用3:1交替堆叠的KDA和MLA架构(每4层模块包含3个Kimi Delta Attention层和1个多头潜在注意力层),结合包含128个路由专家的稀疏MoE FFN。每个token仅激活8个路由专家和1个共享专家,使模型在长上下文建模能力、参数效率和计算成本之间取得平衡。

原生混合推理能力

该模型支持快速响应和多步推理,可通过enable_thinking参数按请求配置思考模式。在通用智能体任务、编码、数学和科学推理以及指令遵循方面均表现出均衡性能。

🚀 性能表现:小身材大能量

AAI与Agentic指数成绩

Ling-3.0-tiny在Artificial Analysis Intelligence Index v4.1.1上获得25分,在Artificial Analysis Agentic Index上获得16分。在Artificial Analysis测试中,输出速度超过160 tokens/s,500-token响应的端到端延迟约为18秒(包括推理时间),凸显了其相对于1.3B激活参数占用的效率优势。

部署效率与速度

专为高效本地部署而设计,已在NVIDIA DGX Spark、Apple Silicon MacBook和Mac mini上验证。使用FP8时,Ling-3.0-tiny在DGX Spark上达到约100-105 tokens/s,在M4 Pro MacBook上达到86-90 tokens/s,在8K上下文长度下峰值内存使用约为8.34 GiB

⚙️ 关键技术参数

参数 数值
总参数 7.9B
每token激活参数 1.3B
隐藏层大小 1536
注意力头数 16
隐藏层数 24
专家数量 128
每token专家数 8
最大上下文长度 131072
词汇表大小 157184

📋 推荐配置与快速启动

推荐采样参数

  • temperature=1.0
  • top_p=0.95
  • top_k=20

支持的部署框架

  • SGLang:提供硬件和特定配方的启动矩阵,包含低延迟和高吞吐量配置
  • vLLM:需安装支持Ling-3.0的专用分支,支持自动工具选择和推理解析器
  • Ollama:在Apple Silicon上通过MLX运行,已在48GB统一内存的M4 Pro Mac上验证

模型文件组成

📝 总结:轻量级智能体的新标杆

Ling-3.0-tiny通过创新的混合线性注意力架构和稀疏MoE设计,在保持高效推理的同时提供了强大的智能体能力。25分的AAI指数和16分的Agentic指数证明了其在各类任务中的均衡表现,而低至1.3B的激活参数使其能够在消费级硬件上流畅运行。无论是本地部署还是资源受限环境,Ling-3.0-tiny都为AI应用提供了一个高效且强大的解决方案。

要开始使用Ling-3.0-tiny,请克隆仓库:

git clone https://gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny

并参考项目中的部署指南选择适合您硬件环境的启动方式。

【免费下载链接】Ling-3.0-tiny 【免费下载链接】Ling-3.0-tiny 项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐