DeepSeek-V2的参数设置整理成表格形式:

模型超参数

参数类别参数名称参数值说明
基础架构Transformer层数60-
隐藏维度5120-
参数初始化标准差0.006-
注意力机制注意力头数(nh)128-
每头维度(dh)128-
KV压缩维度(dc)512-
查询压缩维度(dc’)1536-
解耦查询键每头维度(dhR)64-
MoE配置共享专家数2每个MoE层
路由专家数160每个MoE层
专家中间隐藏维度1536-
激活专家数6每个token
参数规模总参数量236B-
激活参数量21B每个token

训练超参数

参数类别参数名称参数值说明
优化器优化器类型AdamW-
β10.9-
β20.95-
weight_decay0.1-
学习率调度调度策略warmup-and-step-decay-
最大学习率2.4 × 10⁻⁴-
预热步数2K线性增长到最大值
第一次衰减×0.316训练约60% tokens后
第二次衰减×0.316训练约90% tokens后
训练配置梯度裁剪范数1.0-
批次大小调度2304→9216前225B tokens,之后保持9216
最大序列长度4K-
训练tokens总量8.1T-
并行配置流水线并行✓不同层部署在不同设备
路由专家部署设备数8每层均匀部署
设备受限路由最大设备数3每个token最多发送到3个设备
平衡损失α10.003-
α20.05-
α30.02-

数据配置

参数类别参数名称参数值说明
分词器分词算法BBPEByte-level Byte-Pair Encoding
词汇表大小100K-
语料库总tokens8.1T-
中文tokens占比约12%比英文多约12%

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐