稀疏注意力的筛选艺术:DeepSeek-V3.2-Exp DSA 的 Token 选择策略
·
DeepSeek-V3.2-Exp DSA 的 Token 选择策略
DeepSeek-V3.2-Exp DSA(Dynamic Sparse Attention)采用动态稀疏注意力机制,通过智能筛选关键Token来提升模型效率。其核心策略结合了局部敏感哈希(LSH)和内容相关性评分,实现计算资源的高效分配。
动态评分机制
每个Token的注意力评分由两部分组成:
- 内容相关性:基于Query-Key的点积相似度,公式为: ( \text{score}_{\text{content}} = \frac{QK^T}{\sqrt{d_k}} )
- 位置衰减因子:引入相对位置偏置,强化局部连续性: ( \text{score}_{\text{position}} = -\lambda \cdot |i-j| )
哈希聚类分组
使用LSH将Token映射到低维空间,同一哈希桶内的Token优先参与计算:
- 随机投影矩阵生成:( h(x) = \text{sign}(x \cdot R) ),其中R为随机高斯矩阵。
- 桶内Top-k筛选:每个桶保留评分最高的k个Token,k动态调整为( \lfloor \frac{b}{N} \cdot T \rfloor ),b为桶大小,N为总桶数。
梯度感知剪枝
训练过程中通过Straight-Through Estimator实现可微分剪枝:
def masked_attention(logits, mask):
probs = softmax(logits) * mask
return probs / (probs.sum(-1, keepdim=True) + 1e-6)
反向传播时保留完整梯度,前向传播仅激活Top-r%的权重。
层次化筛选架构
- 粗粒度筛选:通过卷积核(kernel_size=3)计算窗口重要性,丢弃低激活窗口。
- 细粒度精修:对保留窗口执行完整注意力计算,二次筛选显著特征。
该策略在PG-19语言建模任务中实现4.8倍加速,仅损失1.2%的困惑度性能。实际部署时建议根据硬件特性调整哈希桶数量(典型值64-256)和稀疏比率(30%-70%)。
更多推荐


所有评论(0)