一、Motivaiton

动态 V2X 场景下,传统资源管理方法泛化不足,RL 在复杂环境中也容易不稳定。并且传统方法没有很好实现模型性能和算力消耗的trade off 

二、Innovation

①基于agent的车路云协同架构:利用云端大模型预训练和路侧端的轻量化模型(简单理解为云上训练边上推理),实现协同训练和实时推理。(这部分与CV的下游应用类似,云服务器算力强所以适合做预训练,路侧和车端算力有限,且道路车辆变化这种要实时,所以需要轻量级模型,即部署压缩、微调后的模型

②生命周期管理策略(lifecycle):通过综合考虑模型预训练、微调的cost 和模型性能的trade off,来动态调节cloud端LAM的更新周期和edge端的微调周期包括模型的剪枝。

③单任务V2X场景下的D-LAM资源管理策略【对于这个资源管理策略下面进一步说明】;多任务下加入MoE(混合专家)+gating 的DM-LAM策略;

资源管理策略:加入时序,将 多资源协调问题 建模成 时间连续下的资源需略决策过程,做decision-making。

举个栗子:我开车要并线,不是按照当下这一秒来决定的,因为随时间流逝路况是多变的(比方第0秒旁边车道很空可以尝试并线,第1秒后车突然加速风险升高,第3秒网络变差了边缘协同延迟变大),嗯对所以为了安全是不能只靠第0秒这一瞬来决定的,必须得实时。

所以才考虑加入时间embedding,就是添加了时间维度来实时决策下一步该做什么,每一步都要按照最新的状况来调整,即状态在变动作也要跟着变,是一个随时间变化下动态的、连续的过程

ps: 当多任务同时来时,还要综合任务优先级、时延和资源消耗,动态平衡全局调度和局部优化,所以在D-LAM基础上加了MoE+gating,不同任务不同专家管理 诸如此类的,即更合理的分配共享资源,个性化但也要兼顾全局。

三、Method

带着问题去看paper:

1)车-路-云怎么协同?vehicle agent、RSU agent、cloud agent分别在做什么?三者怎么形成分工协同和闭环?

2)lifecycle中 模型什么时候更新、微调、剪枝,又是怎么进行的?

3)D-LAM解决什么,怎么做?DM-LAM解决什么,怎么做?二者区别?

1、框架概括

看图中的1-5步骤:

1.Vehicle Agent特征采集:车端负责感知当前车辆所处的 V2V/V2I 场景,并将场景特征上传至RSU(采集到的状态信息,如图包括带宽、计算资源、环境特征等)。

2.RSU Agent处理:中间层RSU(图中绿色块),【如图紫框】表示接收步骤1的场景特征做本地数据的整合和构建,并对特征进行自适应压缩(保护数据隐私)上传至云端以便后续更新训练;

3.Cloud Agent 聚合数据并进行 D/DM-LAM 预训练:云端将cloud database(即结合收到RSU的数据+构造prompt+外部知识检索)作为输入;  送进D/DM-LAM中进行训练,并监控模型性能对LAM剪枝(即取D/DM-LAM模型的部分作为后续RSU的轻量化模型的部署),进入步骤4;云端另外控制着lifecycle【将在后面小节详细介绍,主要负责整个架构中边端微调和云端大模型更新周期、剪枝率的动态调控】

4.RSU轻量化模型部署:上面3-③得到的剪枝后的D/DM-LAM下发到RSU后,【如图红框】表示将剪枝后的模型进一步量化、蒸馏,然后根据任务做few-shot微调模型性能监控

5.RSU Agent 进行边缘推理和资源调度:RSU端通过轻量化模型Edge AI modle做推理,得到实时场景的资源调度action(包括 V2V/V2I转换、功率分配、task offloading、GPU/CPU 资源匹配等)。

6.lifecycle:Cloud和RSU的模型性能监控会反馈到云端的Collaborative Model Lifecycle Control,动态调整微调、预训练模型更新、剪枝,实现性能和cost的trade-off,持续优化。

得益于lifecycle,这个框架并不是“一次训练永久固定使用”,而是一个随着环境变化不断更新、微调和优化的过程

2、架构技术细化

(1)数据构建/输入:

不论单一或多种Vehicle Agent,持续运行时,会从车辆传感器、车载日志等中采样数据,并提取信息(环境特征、计算资源、通信资源、行为特征、资源分配动作以及系统性能指标)。随后,这些特征会被整理成RL的 (state,action,reward)样本形式先存储在RSU端,再上传至云端

But!!完成(1)资源管理样本构建之后,并没有直接将这些数据输入LAM,而是进一步结合场景特征设计 prompt,并将样本组织成适合 LAM 处理的序列化输入,详情见(2).

(2)Prompt 设计与序列化输入构造

①prompt设计:云端会结合memory针对不同场景设计prompt(eg.低时延场景和计算量大场景会有不同的prompt模板)。

②Data设计:训练样本则被整理成 (state,action,RTG) 的形式,其中RTG=\sum_{\tau=t}^{T}R_{\tau} 用来表示t-T的累计收益,帮助模型学习连续时间下的资源调度效果。

Input Sequence:prompt + 状态信息 + .... + RTG送入 D-LAM 作为sequence输入。(这样是为了使模型在生成资源调度决策时,不仅能够结合当前环境状态,还能同时考虑任务目标、空间关系和长期收益,从而更适合V2X 场景下的动态建模)

(3)D/DM-LAM做序列建模

①Decision LAM,其实就是transformer做序列预测:给sequence加position得到encoding  --> LN  -->  多头注意力 --> feedforward 

② D/DM-LAM得到输出的预测结果,计算损失(这里的loss更像是reward function):

G_{sys}=ln(\overline{\omega}\frac{y_{all}(t)}{D_{all}(t)}),表示 准确率/时延,值越大效果越好,用来更新预训练模型。

③ Expert + Gating Network:车辆要做多个异构任务(multi-task),通过专家机制+门控实现不同任务给不同专家系统来决定是在本地处理、边缘协作还是上传到云端,即DM-LAM。

(4)边端模型轻量化部署

Cloud Agent将剪枝后的预训练模型下载至RSU Agent后,RSU对模型进一步轻量化部署 —— 量化(减少内存和计算量) + LoRA微调(这里用本地增量少量样本即Local Training Sample做特定任务的模型微调)。

(5)lifecycle

【这部分是对 整个车路云框架的LAM更新、微调、剪枝做周期调控的,我认为单拎出来讲比较合适,所以这里跟论文顺序不同,我调整了放到最后一个模块来说明】

基本思想是:短期变化先由边端微调快速推理,当多轮微调收益下降后,再触发云端大规模模型更新,并结合剪枝控制部署开销。由此达到模型开销和性能之间的trade-off。

即模型部署后,RSU 不断把运行中遇到的新场景、新状态、新决策结果记录下来,形成本地增量数据集。如果只是小变化,就用这些数据做边端微调;如果环境变化超过阈值,就把这些增量数据上传到云端做重新更新预训练模型。所以,需要知道什么时候微调,什么时候更新预训练模型,剪枝到什么程度

Resource Monitoring & Model Evaluation,表示持续监控cost和性能指标,看现在带宽够不够、算力够不够...

②Actor Network 决定三个控制量 ——

1)微调cycles:\delta_{fine}=p\tau,表示每隔 p个 transmission slots,就在边端做一次微调。

2)模型更新cycle:RetrainingCycle=\lambda+K\delta_{fine},表示经过k轮边缘微调 + 一个更新窗口就更新一次预训练模型。

3)剪枝率

四、实验(待补充)


BASIC(整理中)

1、动态资源适应困难(dynamic resorce adaptation)

按个人理解简单概括为:车-边-云的计算能力和数据延迟存在差异性,且多任务之间存在异构性,所以需要进行多方面的自适应调节,即包括传感器、通信、云计算、AI模型的多种资源协调。

2、V2X 技术:Vehicle-to-Everything

V2X包含V2V(车和车)、V2P(车和人)、V2I(车和路边单元)、V2C(车和云)。

本质上是一种互联网技术,V2X是指车(V)和车、人、路、设备等一切可以连接的事物(X)间的信息。即通过道路、行人、车辆之间的协调来实现整个道路运输的智能化

举个栗子:比如前方有车要变道,发个指令给基站,基站再通知后方车辆注意慢行(所以大致可以理解为什么自动驾驶很需要V2X技术)

3、AI agent

【老师说关注智能体,我想的是AI agent的概念,对于这部分内容我也进行了大致了解,因为之前接触的更多的内部LLM比如gpt,而这里了解到AI agent更像是把LLM投入完整下游应用成为助手,感觉像前阵子爆火的小龙虾(】

①prompt ②context上下文学习 ③LLM ④Tool(参数)⑤结果反馈

不同 agent 有不同职责,通过信息流和控制流协同工作

4.量化、蒸馏、剪枝

量化降低i数据精度,eg.float->int可能损失精度
蒸馏

师-生模型,学生学习老师的软标签和GT硬标签,即  Loss = β KL_loss +  (1-β)交叉熵_loss

依赖大模型Large
剪枝去掉一些不重要参数,eg.拿掉一些通道数/卷积层要微调

5、关于相关技术的回溯

①资源簇分配 ②强化学习--受限于环境,奖励稀疏和噪音导致无法适应新环境 ③LAM,环境泛化性好【源于论文:Large Language Model Enhanced MultiAgent Systems for 6G Communications】

《Large-Scale Video Analytics with Cloud-Edge Collaborative Continuous Learning》云边缘协作架构。通过联合考虑云中的再训练频率和边缘的推理帧率,实现了基于梯度的资源分配,以优化推理精度。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐