【语义通信】多时间尺度双层控制!分布式分层DRL赋能语义感知资源分配【附python代码】
多时间尺度双层控制!分布式分层DRL赋能语义感知资源分配
一、题目
面向语义感知资源分配的分布式分层深度强化学习
二、摘要
相较于传统仅关注比特传输的体验质量优化,考虑语义体验质量能更优地对网络进行优化,提升用户体验。本文提出一种新颖的分布式分层深度强化学习(DHDRL)框架,该框架采用不同时间尺度下的双层控制策略,对包含语义速率和语义精度的下行多小区网络体验质量进行优化。具体而言,本文将优化问题分解为波束成形与功率分配、语义资源分配两个子问题,分别对应无限时域离散马尔可夫决策过程和有限时域连续时间马尔可夫决策过程。为解决上述子问题,本文设计了双层神经网络:在网络层,提出分布式高层神经网络,在大时间尺度上抑制小区间干扰、提升网络性能;在链路层,设计分布式低层神经网络,在小时间尺度上提升语义压缩率,满足各类语义精度和速率需求。数值结果表明,该分布式分层深度强化学习框架相较单层方法实现了至少19.07%的性能增益,在高维场景中保持有效性,且在各类多目标优化问题中展现出强泛化能力。
三、引言
移动通信技术不断演进,以满足自动驾驶、医疗健康、全息投影等日益多样化的用户体验需求。然而,互联智能设备数量和无线数据量呈指数级增长,加剧了频谱资源的稀缺性,成为无线网络面临的重大挑战。在此背景下,语义通信为突破传统通信系统的局限性提供了前瞻性解决方案。借助语义感知能力,无线网络能够深度理解通信的真实意图,从更高维度评估和优化网络性能,更高效地满足边缘设备智能任务的需求。
语义感知无线网络将语义编解码器融入通信系统:在网络层,利用波束成形、功率分配等技术抑制信道衰落和干扰;在链路层,通过自适应语义压缩率等语义资源分配手段提升体验质量。与传统主要关注比特级信号传输保真度的体验质量不同,语义体验质量强调所传输内容的完整性和上下文关联性,能更精准地评估语义传输性能,可被建模为语义精度和语义速率的函数。其中,语义精度衡量原始信息与恢复信息间的语义距离,语义速率反映语义信息的传输速率。
但网络层与链路层的跨层目标联合优化存在极大复杂性:传统无线网络本身包含大量优化参数和变量,而语义传输又引入了一系列高维优化目标,形成多维优化难题。因此,如何有效管理和协调这些优化目标,使网络实现自配置、自优化,以适应网络层和链路层的动态环境与需求,成为亟待解决的问题。
网络层的核心目标是有效抑制小区间干扰,为链路层的语义传输奠定可靠基础,基站需根据实时共享信息动态调整波束方向和发射功率,在提升当前链路信干噪比的同时,避免对邻接设备造成干扰。未来,小区规模可能进一步缩小,无线设备数量却呈爆发式增长,海量的业务量和信令开销将导致传输性能下降。
在链路层,依托神经网络的语义通信技术能将大规模源数据高效压缩为紧凑的语义特征,消除高维数据中的冗余,在数据表示、压缩和传输方面具备显著优势。语义特征捕捉源数据的内在含义,通常由神经网络的中间输出得到,具有抽象性和主观性,且语义压缩面向具体任务,依赖智能应用的特定需求,因缺乏统一标准而兼具鲁棒性和灵活性。
此外,网络层的持续调优面临诸多挑战:多基站协作所需的缓存和同步机制构建耗时,且会产生大量信息交互开销,频繁的网络重构还会消耗计算能力、前传容量等大量资源,因此网络层优化更适合在大时间尺度上进行。与之相反,链路层的传输内容和用户需求变化迅速,需要在小时间尺度上频繁适配以提升体验质量。若将网络层与链路层的联合配置直接构建为传统的单层优化问题,会面临计算复杂度高、可扩展性有限、需持续重新优化等多重问题。
为此,本文提出分布式分层深度强化学习框架,从两个时间分辨率最大化整个无线网络的体验质量性能:在网络层以粗粒度维度优化小区间干扰,在链路层以更精细的时间尺度优化实时语义资源。本文将服务时间划分为连续的帧,每帧包含固定数量的时隙,大时间尺度聚焦波束成形与功率分配配置以最大化信干噪比,小时间尺度则围绕语义资源分配提升包含语义速率和精度的体验质量。在每一帧中,基于帧级观测信息更新长期波束成形与功率分配策略,基于时隙级实时连续信息优化短期语义资源分配。
四、方法简介
本文提出分布式分层深度强化学习(DHDRL) 框架,采用多时间尺度双层控制策略,将多小区语义感知网络的资源分配优化问题拆解为网络层和链路层两个子问题,通过分层神经网络分别求解,实现波束成形与功率分配(BPA)、语义资源分配(SRA)的联合优化,核心设计如下:
- 问题分解与马尔可夫决策过程建模
将优化问题拆解为网络层波束成形与功率分配、链路层语义资源分配子问题,其中网络层对应无限时域离散马尔可夫决策过程(大时间尺度),链路层对应有限时域连续时间马尔可夫决策过程(小时间尺度),服务时间划分为“帧-时隙”两级时间单位,帧级执行网络层优化,时隙级执行链路层优化。
-
双层分布式神经网络设计
-
高层网络(网络层):分布式部署于各基站,以小区间干扰、信道增益、历史体验质量等为观测信息,输出波束成形和功率分配决策,奖励为帧内体验质量增益,在大时间尺度抑制小区间干扰、提升链路信干噪比;
-
低层网络(链路层):同样分布式部署,以网络层输出的波束/功率配置、实时信道状态为观测信息,动态调整语义压缩率,奖励为时隙内体验质量增益,在小时间尺度匹配用户的语义速率和精度需求。
-
-
分布式训练与迭代更新
采用深度Q网络(DQN)构建高低层网络,各基站独立拥有神经网络并进行数据处理,通过ε-贪心策略选择动作,结合经验回放机制训练网络;高低层网络相互迭代更新,高层网络基于固定的低层网络策略优化系统级干扰,低层网络基于优化后的高层网络配置调整语义资源,最终实现双层策略的协同最优。
- 复杂度优化
观测信息仅采用信道状态统计量而非精确的信道矩阵,大幅降低信令开销和信道训练时长;采用码本化的波束成形、功率分配和语义压缩率设计,将连续动作空间离散化,解决高维场景下的维度爆炸问题。
五、结论
本文构建了多小区多用户语义感知无线网络,为优化具备语义精度和速率需求的各类设备的体验质量,提出一种新颖的、采用多时间尺度控制策略的分布式联合波束成形、功率分配与语义资源分配方案。为解决该联合优化问题,本文将其解耦为分别对应无限和有限马尔可夫决策过程的两个子问题,设计了以波束成形与功率分配为元控制器、语义资源分配为控制器的分布式分层深度强化学习架构(DHDRL)。
数值结果表明,所提分布式分层深度强化学习框架能高效解决复杂的多时间尺度决策多目标优化问题,可为语义感知通信网络分别配置适配的网络层和链路层参数,实现对动态网络环境的鲁棒适配,同时满足多样化的语义需求。
未来研究可从两方面拓展该框架:一是纳入时延约束、能效指标等更多优化参数和约束条件;二是构建通用的语义熵模型,对更广泛通信场景中的语义信息进行定量表征。
更多推荐

所有评论(0)