DeepSeek-V3.2-Exp DSA 的 Token 选择策略

DeepSeek-V3.2-Exp DSA(Dynamic Sparse Attention)采用动态稀疏注意力机制,通过智能筛选关键Token来提升模型效率。其核心策略结合了局部敏感哈希(LSH)和内容相关性评分,实现计算资源的高效分配。

动态评分机制

每个Token的注意力评分由两部分组成:

  • 内容相关性:基于Query-Key的点积相似度,公式为: ( \text{score}_{\text{content}} = \frac{QK^T}{\sqrt{d_k}} )
  • 位置衰减因子:引入相对位置偏置,强化局部连续性: ( \text{score}_{\text{position}} = -\lambda \cdot |i-j| )
哈希聚类分组

使用LSH将Token映射到低维空间,同一哈希桶内的Token优先参与计算:

  1. 随机投影矩阵生成:( h(x) = \text{sign}(x \cdot R) ),其中R为随机高斯矩阵。
  2. 桶内Top-k筛选:每个桶保留评分最高的k个Token,k动态调整为( \lfloor \frac{b}{N} \cdot T \rfloor ),b为桶大小,N为总桶数。
梯度感知剪枝

训练过程中通过Straight-Through Estimator实现可微分剪枝:

def masked_attention(logits, mask):
    probs = softmax(logits) * mask
    return probs / (probs.sum(-1, keepdim=True) + 1e-6)

反向传播时保留完整梯度,前向传播仅激活Top-r%的权重。

层次化筛选架构
  1. 粗粒度筛选:通过卷积核(kernel_size=3)计算窗口重要性,丢弃低激活窗口。
  2. 细粒度精修:对保留窗口执行完整注意力计算,二次筛选显著特征。

该策略在PG-19语言建模任务中实现4.8倍加速,仅损失1.2%的困惑度性能。实际部署时建议根据硬件特性调整哈希桶数量(典型值64-256)和稀疏比率(30%-70%)。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐