🔬 CMA-Former:基于级联多头注意力Transformer的高精度波达方向估计

深度神经网络遇上阵列信号处理,用Transformer从协方差矩阵中"听"出信号的来向
原文链接


📡 一、研究背景:波达方向估计为何重要?

在我们日常生活中,雷达探测、5G/6G无线通信、声纳定位、自动驾驶感知……这些技术背后都离不开一个核心问题:信号究竟从哪个方向传来?

这就是波达方向估计(Direction of Arrival Estimation, DOA)问题。

想象一下:一个由多根天线组成的阵列同时接收多路信号,你需要从这些混合信号中精确判断每一路信号的入射角度。当信噪比很低、或者多个信号源的角度非常接近时,传统方法往往难以准确分辨。在这里插入图片描述

传统DOA方法的局限:

  • MUSIC算法:经典子空间方法,通过特征分解将信号空间与噪声空间分离,但在低信噪比和少快拍场景下性能急剧下降
  • ESPRIT算法:利用阵列的旋转不变性,但对阵列校准误差敏感
  • 传统方法普遍依赖精确的阵列模型假设,在存在互耦、校准误差等非理想场景中表现不佳

近年来,深度学习为DOA估计带来了全新思路。但现有方法仍存在不足:

  • CNN方法:将协方差矩阵视为图像处理,空间感知能力有限
  • DNN方法:使用全连接网络,缺乏对协方差结构中长程依赖关系的建模
  • DCT-ViT/HMC-ViT:引入Vision Transformer,但仅使用单尺度的注意力机制,难以同时捕获局部细节和全局结构

🚀 二、CMA-Former:一种全新的解决方案

针对上述挑战,来自IEEE Transactions on Cognitive Communications and Networking的最新论文提出了CMA-Former(Cascaded Multi-Head Attention Transformer)——一种级联多头注意力Transformer框架,用于高精度波达方向估计。
在这里插入图片描述

核心思想

CMA-Former将DOA估计问题转化为多标签分类问题:将空间角度从-60°到60°以1°为间隔离散化为121个网格点,模型的输出是一个121维的空间谱,每个维度的值表示对应角度存在信号源的概率。

关键创新点

1️⃣ 协方差矩阵的Token化表示

CMA-Former没有直接处理原始接收信号,而是先计算样本协方差矩阵,然后提取其上三角非对角元素作为输入Token。对于16根天线的均匀线阵,共有 C(16,2) = 120 个上三角非对角元素。在这里插入图片描述

每个复数协方差元素被分解为四通道表示:

  • 实部(Real)
  • 虚部(Imaginary)
  • 相位正弦(sin(angle))
  • 相位余弦(cos(angle))

💡 这种四通道分解策略完整保留了协方差矩阵的幅度和相位信息,为Transformer提供了丰富的特征表达。

2️⃣ 级联多头注意力机制(核心创新)

这是CMA-Former最核心的设计。每个Transformer编码块内部串行级联多个不同头数的多头自注意力(MSA)模块:

编码块输入 → MSA(4头) → MSA(8头) → MSA(16头) → MLP → 编码块输出

这种多尺度级联设计的意义在于:

  • 少头数(4头):关注局部精细特征,捕捉相邻天线对之间的细微相关性
  • 中头数(8头):建模中等尺度的特征交互
  • 多头数(16头):捕获全局长程依赖,理解整个阵列的宏观空间结构

通过这种由细到粗、由局部到全局的层次化注意力设计,CMA-Former能够从多个粒度层面理解协方差矩阵中蕴含的空间信息。在这里插入图片描述

3️⃣ 灵活的位置编码策略

由于协方差矩阵的上三角元素并非天然具有序列顺序,如何为Token注入位置信息至关重要。CMA-Former支持三种位置编码:

  • 可学习位置编码(Learnable PE):让模型自己学习最优的位置表示
  • 天线对感知编码(Pair-aware PE):为每个天线对(i, j)分别学习行列嵌入,更好地反映物理天线位置关系
  • 延迟感知编码(Lag-aware PE):基于天线间距(j-i)编码,捕捉协方差元素之间的自然拓扑关系
4️⃣ 完备的训练与推理框架
  • 分类头设计:使用多层MLP或线性层作为输出头,将聚合后的特征映射到121维角度网格
  • CLS Token聚合:采用类似BERT的[CLS] Token机制,在输入序列首部添加可学习的分类Token,以其最终输出作为全局特征表示
  • Gaussian软标签:为提高角度估计精度,使用高斯软标签替代传统的硬二值标签,在真实角度附近形成平滑的概率分布
  • 双阶段精炼:在软标签基础上进行二次精炼,进一步提升估计精度
    在这里插入图片描述

📊 三、实验验证:全面碾压的性能表现

CMA-Former在多个维度上进行了严格的实验验证,与CNN、DNN、DCT-ViT、HMC-ViT以及传统MUSIC算法进行了全面对比。

3.1 不同信噪比下的RMSE对比

在-20dB到0dB的信噪比范围内,对1至4个信号源场景进行2000次蒙特卡洛实验。结果显示:

场景 CMA-Former优势
单源 所有SNR下均接近CRB理论下界
双源 低SNR时RMSE仅为MUSIC的1/3~1/5
三源 中低SNR下显著优于所有对比方法
四源 差距最大,证明了多尺度注意力的优势

📌 CMA-Former在0dB SNR下对四目标的RMSE仅为0.15°,而MUSIC约为2.5°,差距超过15倍。在这里插入图片描述

3.2 超分辨能力:角度间隔实验

当两个信号源的角度非常接近时,传统方法往往无法分辨。CMA-Former在角度间隔为2°的极端场景下仍能保持较高的检测成功率,而MUSIC在角度间隔小于8°时性能急剧恶化。

对于三源场景,CMA-Former在10°间隔下即可准确分辨所有目标,展现了出色的超分辨能力。

3.3 快拍数鲁棒性

在仅有10个快拍的极端条件下,CMA-Former仍然能够给出有意义的DOA估计结果。随着快拍数增加到50以上,性能迅速接近最佳水平。这种小样本能力在实际应用中尤为重要——它可以大幅减少数据采集时间。在这里插入图片描述

3.4 非理想场景鲁棒性

论文进一步在两种典型非理想场景中验证了CMA-Former的鲁棒性:

  • 互耦效应:天线之间存在电磁耦合时,CMA-Former的性能下降幅度远小于传统方法
  • 校准误差:存在幅度和相位校准偏差时,CMA-Former仍保持较高的估计精度

🛡️ 这证明了基于学习的DOA估计框架天然具备对阵列非理想因素的容忍能力,因为它从数据中学习的是"端到端"的映射关系,而非依赖于精确的解析阵列模型。

3.5 真实暗室数据验证

为验证模型的实用价值,CMA-Former在真实微波暗室采集的数据上进行了测试。实验结果表面,CMA-Former能够准确预测真实环境中的信号来向,进一步证明了其从仿真到真实场景的迁移能力。在这里插入图片描述

3.6 计算效率对比

指标 CMA-Former CNN DCT-ViT HMC-ViT
参数量 适中 较少 稍多 相当
推理时延 最低或次低 较高
训练内存 高效 高效 较高

CMA-Former在计算效率与估计精度之间取得了优异的平衡,使其在实时DOA估计应用中具有实际部署价值。

3.7 消融实验:每个设计的价值

论文通过严格的消融实验验证了每个设计组件的作用:

  • 级联多头(Multi-Scale)vs 固定头数(Single-Scale):多尺度级联注意力是CMA-Former性能的关键,4-8-16头的混合配置显著优于所有单一头数配置(4头×3、8头×3、16头×3等)
  • LayerScale:添加可学习的逐通道缩放,进一步提升训练稳定性
  • Schedule DropPath:随深度递增的DropPath策略优于固定DropPath和无DropPath
  • CLS Pooling vs Mean Pooling:CLS Token池化优于均值池化
  • MLP Head vs Linear Head:多层MLP分类头略优于线性头
  • Hard Label vs Soft Label:高斯软标签 + 双阶段精炼能进一步提升角度估计精度

🔍 四、为什么CMA-Former如此高效?

总结CMA-Former的成功秘诀,可以归结为以下几点:

  1. 从数据中学习:不依赖精确的阵列解析模型,直接从协方差结构中学习DOA映射,天然具备对非理想因素的鲁棒性
  2. 多尺度注意力:级联不同头数的多头注意力,从局部到全局层次化建模空间特征
  3. 完整信息保留:四通道复数分解策略完整保留了协方差矩阵的幅度和相位信息
  4. 结构化输入表示:提取协方差上三角元素作为Token,既降低了输入维度,又保留了核心的空间相关结构
  5. 高效计算:Transformer架构天然支持并行计算,推理速度快于部分传统方法

🎯 五、应用前景

CMA-Former为以下场景提供了有力的技术支撑:

  • 📱 5G/6G通信:精准的用户定位和波束管理
  • 🚗 自动驾驶雷达:高分辨率的目标方位感知
  • 🛰️ 雷达与电子侦察:在复杂电磁环境中分辨密集信号源
  • 🎤 声源定位:智能语音设备中的声源追踪
  • 📡 射电天文:微弱天体信号的来向估计

📝 总结

CMA-Former通过将Transformer的多头注意力机制创造性地引入DOA估计领域,并提出级联多尺度注意力的创新设计,在保持高效计算的同时,显著提升了DOA估计的精度和鲁棒性。在低信噪比、小角度间隔、少快拍以及非理想阵列等多种挑战性场景下,CMA-Former均展现出了全面超越传统方法和现有深度学习方法的性能。

这项工作不仅为DOA估计提供了一种实用且高性能的解决方案,也为Transformer在信号处理领域的应用开辟了新的思路。


🌟 如果您对本文有任何疑问或想法,欢迎在评论区留言讨论!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐