1. 项目概述

在过去的二十年里,γ射线天文台,特别是成像大气切伦科夫望远镜(IACT)阵列,彻底改变了我们对极高能(VHE)γ射线天空的认识。位于纳米比亚的高能立体系统(H.E.S.S.)是研究GeV到TeV能量范围内宇宙γ射线的关键设施。IACT通过记录宇宙粒子引发的大气簇射中次级粒子发射的切伦科夫辐射来成像。传统上,Hillas参数被用来描述簇射的形状,估计初级粒子的能量和重建其入射方向,并拒绝数量远超γ射子的强子簇射。

γ射线数据分析需要深入理解仪器响应函数(IRFs),这些函数用于通过前向折叠理论模型来解释观测结果。大规模蒙特卡洛(MC)模拟是精确推导IRFs的必要手段,但这些模拟,特别是针对强子背景的模拟,计算量巨大且耗时。每个事件通常需要30-60秒的CPU核心计算时间,每个观测周期生成的数据量可达数百GB。此外,随着仪器老化,还需要新的模拟来适应性能的微小变化。

近年来,深度学习技术的进步为物理学和高能物理研究中的数据分析和模拟提供了新的视角。特别是生成模型为模拟高维数据提供了新的机会。在粒子物理中,生成对抗网络(GANs)、归一化流和扩散模型已被用作仪器的替代模型,将模拟速度提高了五到六个数量级。这些替代模型可以用于适应不同的条件,并优化模拟以匹配测量数据。此外,这些可微分的替代模型解锁了一系列下游任务,包括仪器优化、事件重建、异常检测、展开和非微扰过程(如强子化)的建模。

2. 深度学习在IACT图像生成中的应用

2.1 Wasserstein生成对抗网络(WGAN)

生成对抗网络(GANs)由生成器G和判别器D组成,两者通过对抗训练共同优化。生成器负责从简单噪声分布生成逼真的样本,而判别器则负责区分真实样本和生成样本。在训练过程中,生成器和判别器交替优化,生成器试图生成能够欺骗判别器的样本,而判别器则不断提高其区分能力。

Wasserstein GANs(WGAN)是GANs的改进版本,通过使用Wasserstein距离作为损失函数,显著提高了样本质量、多样性和训练稳定性。Wasserstein距离为高维分布提供了一种相似性度量,尤其适用于不相交的分布。在WGAN中,判别器被训练来近似生成样本和真实样本分布之间的Wasserstein距离,而生成器则被训练来最小化这一距离,从而使生成样本的分布更接近真实分布。

在本研究中,我们采用了WGAN架构,该架构在生成γ射线簇射图像方面表现出色。生成器和判别器均使用了卷积层的残差连接,以提升模型的表达能力。此外,生成器还通过条件网络对粒子的能量和撞击点进行条件化生成,进一步提高了生成样本的物理准确性。

2.2 扩散模型(Diffusion Models)

扩散模型在图像合成和快速替代昂贵物理模拟方面表现出色。扩散模型通过逐步去噪的过程生成样本,其训练过程相对简单且稳定。扩散过程被设计为在时间t=1时,数据完全由噪声主导(通常为标准正态分布),而在t=0时,数据逐渐演变为目标分布(即γ射线或质子簇射的IACT图像)。

在训练阶段,扩散模型学习预测噪声的分布,并通过迭代去噪生成样本。我们采用了基于分数的扩散模型(SBDM),该模型通过预测噪声的线性组合(称为速度项)来优化生成质量。生成新图像时,我们使用训练好的神经网络近似速度项,并通过求解常微分方程(如DDIM求解器)逐步去噪。

扩散模型的一个显著优势是其生成质量优于GANs,尤其是在捕捉复杂分布(如强子簇射的涨落)时表现更佳。此外,扩散模型的训练过程更加稳定,不需要像GANs那样精细调整超参数。

3. 实验设置与评估

3.1 数据集与训练策略

我们使用了H.E.S.S. CT5望远镜的模拟数据,其相机采用FlashCam设计,包含1,758个光电倍增管(PMTs)。模拟数据通过CORSIKA和sim_telarray生成,覆盖能量范围从10^-1.5 TeV到10^2 TeV的γ射线和质子事件。数据集经过校准和噪声去除(如tail-cuts清理)后,包含约153万γ射线图像和63万质子图像。

扩散模型在8块NVIDIA A100-SXM4-80GB GPU上训练了1500个epoch,耗时约20小时(质子模型)和44小时(γ射线模型)。训练使用了Lion优化器和余弦学习率衰减,批量大小为4096。生成图像时,全局模型和图像模型分别使用512和64步去噪,以平衡生成速度和质量。

3.2 生成效率对比

表1比较了不同方法生成10万张IACT图像的计算时间。传统MC模拟在单CPU核心上需要860小时(γ射线)和1320小时(质子),而WGAN在GPU上仅需2.6秒,速度提升了约120万倍。扩散模型在GPU上生成时间约为27分钟,速度提升了1900-2900倍。尽管扩散模型的生成速度不及WGAN,但其生成质量更高,尤其在强子图像中表现更优。

3.3 生成质量评估

我们通过视觉检查、低层观测值和高层Hillas参数对生成图像的质量进行了全面评估。视觉检查显示,扩散模型生成的γ射线和质子图像在形态和细节上与MC模拟高度一致(见图4)。低层观测值(如像素值、图像大小、信号像素数量)的分布也表明,扩散模型能够准确捕捉数据的统计特性(见图5)。

高层Hillas参数(如长度、宽度、偏度和峰度)的对比进一步验证了生成图像的物理合理性。扩散模型在所有参数上的表现均优于WGAN,尤其是在强子图像的复杂涨落建模方面(见图7)。此外,扩散模型生成的图像在γ-强子分离任务中表现优异,为未来高能物理实验的数据分析提供了可靠的工具。

4. 结论与展望

深度学习技术,特别是WGAN和扩散模型,为高能物理实验中的IACT图像生成提供了高效且准确的解决方案。扩散模型在生成质量和物理一致性上显著优于WGAN,尽管其生成速度稍慢。通过进一步优化(如渐进蒸馏技术),扩散模型的生成速度有望提升一到两个数量级。

未来工作将探索扩散模型在立体IACT图像生成中的应用,并研究其在其他高能物理实验(如CTA)中的潜力。此外,这些生成模型还可用于仪器优化、事件重建和异常检测等下游任务,为高能物理研究开辟新的可能性。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐