Ling-3.0-tiny性能评测:25分AAI指数与16分Agentic指数背后的技术密码
Ling-3.0-tiny性能评测:25分AAI指数与16分Agentic指数背后的技术密码
【免费下载链接】Ling-3.0-tiny 项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny
Ling-3.0-tiny是一款轻量级混合推理MoE模型,拥有7.9B总参数和仅1.3B每token激活参数,专为在低推理成本下提供强大的推理和智能体能力而设计,使高级模型功能更易于在本地和资源受限环境中部署。
🌟 核心架构解析:效率与性能的完美平衡
混合线性注意力架构
Ling-3.0-tiny采用3:1交替堆叠的KDA和MLA架构(每4层模块包含3个Kimi Delta Attention层和1个多头潜在注意力层),结合包含128个路由专家的稀疏MoE FFN。每个token仅激活8个路由专家和1个共享专家,使模型在长上下文建模能力、参数效率和计算成本之间取得平衡。
原生混合推理能力
该模型支持快速响应和多步推理,可通过enable_thinking参数按请求配置思考模式。在通用智能体任务、编码、数学和科学推理以及指令遵循方面均表现出均衡性能。
🚀 性能表现:小身材大能量
AAI与Agentic指数成绩
Ling-3.0-tiny在Artificial Analysis Intelligence Index v4.1.1上获得25分,在Artificial Analysis Agentic Index上获得16分。在Artificial Analysis测试中,输出速度超过160 tokens/s,500-token响应的端到端延迟约为18秒(包括推理时间),凸显了其相对于1.3B激活参数占用的效率优势。
部署效率与速度
专为高效本地部署而设计,已在NVIDIA DGX Spark、Apple Silicon MacBook和Mac mini上验证。使用FP8时,Ling-3.0-tiny在DGX Spark上达到约100-105 tokens/s,在M4 Pro MacBook上达到86-90 tokens/s,在8K上下文长度下峰值内存使用约为8.34 GiB。
⚙️ 关键技术参数
| 参数 | 数值 |
|---|---|
| 总参数 | 7.9B |
| 每token激活参数 | 1.3B |
| 隐藏层大小 | 1536 |
| 注意力头数 | 16 |
| 隐藏层数 | 24 |
| 专家数量 | 128 |
| 每token专家数 | 8 |
| 最大上下文长度 | 131072 |
| 词汇表大小 | 157184 |
📋 推荐配置与快速启动
推荐采样参数
temperature=1.0top_p=0.95top_k=20
支持的部署框架
- SGLang:提供硬件和特定配方的启动矩阵,包含低延迟和高吞吐量配置
- vLLM:需安装支持Ling-3.0的专用分支,支持自动工具选择和推理解析器
- Ollama:在Apple Silicon上通过MLX运行,已在48GB统一内存的M4 Pro Mac上验证
模型文件组成
- 配置文件:config.json、generation_config.json
- 架构定义:configuration_bailing_moe_v3.py、modeling_bailing_moe_v3.py
- 权重文件:model-00000-of-00032.safetensors至model-00031-of-00032.safetensors
📝 总结:轻量级智能体的新标杆
Ling-3.0-tiny通过创新的混合线性注意力架构和稀疏MoE设计,在保持高效推理的同时提供了强大的智能体能力。25分的AAI指数和16分的Agentic指数证明了其在各类任务中的均衡表现,而低至1.3B的激活参数使其能够在消费级硬件上流畅运行。无论是本地部署还是资源受限环境,Ling-3.0-tiny都为AI应用提供了一个高效且强大的解决方案。
要开始使用Ling-3.0-tiny,请克隆仓库:
git clone https://gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny
并参考项目中的部署指南选择适合您硬件环境的启动方式。
【免费下载链接】Ling-3.0-tiny 项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/Ling-3.0-tiny
更多推荐



所有评论(0)