NeurIPS 2025|LACER:面向多源强化学习状态编码的大语言模型驱动的复合神经网络架构搜索
1.论文信息
- 论文标题:LLM-Driven Composite Neural Architecture Search for Multi-Source RL State Encoding
- 论文作者:Yu Yu, Qian Xie, Nairen Cao, Li Jin
- 论文链接:https://arxiv.org/pdf/2512.06982
- 会议:NeurIPS2025
2.论文贡献
本文首次明确并形式化面向强化学习状态编码的复合 NAS 问题,即联合优化多个源专属模块与融合模块。除采样效率外,另一大挑战是有效利用辅助信息(如各模块的表征质量、专用性),而现有 NAS 方法通常忽略或无法有效建模这类信息。
为此,本文提出大语言模型驱动的 NAS 流程,借助语言模型对模块设计选择与表征质量的先验,自动为强化学习搜索高性能复合状态编码器架构。本文主要贡献如下:
- 提出并严格定义面向多源强化学习状态编码的复合 NAS 问题。
- 提出大语言模型驱动的 NAS 流程,融合语言模型先验,结合模块表征质量的辅助信息引导搜索。
- 在混合自动驾驶交通控制任务上实现并验证所提框架,展现更优的搜索效率与强化学习性能。
3.论文创新点
-
首次定义多源强化学习状态编码的复合 NAS 问题
把多模态 / 多源输入(传感器、时序、图像、文本)的 RL 状态编码,形式化为复合架构搜索问题。
同时优化多个源专属编码器 + 一个融合模块,而不是单编码器搜索。 -
提出 LLM 驱动的复合 NAS 流水线(LACER)
把 LLM 当作架构设计智能体,用语言先验引导搜索。
首次在 NAS 中利用中间表征信号:不仅给最终奖励,还把表征质量、模块互信息、特征冗余度喂给 LLM。 -
显著提升 RL 场景下 NAS 的样本效率
RL 中评估一次架构极贵,本文用更少候选就能搜到更强架构。在混合自动驾驶交通控制上,性能超过:
- 人工设计架构
- DARTS / ENAS / PEPNAS 等传统 NAS
- GPT‑4 驱动的 GENIUS 方法
并验证可迁移到 MiniGrid 目标任务、ManiSkill 机器人控制。
4.方法
本文聚焦端到端场景,编码器架构与强化学习智能体联合优化。
端到端训练:直接搜索最大化任务奖励的架构
状态编码器(神经网络架构) 和 强化学习智能体(策略网络)不分开训练,而是从头到尾一起训练、一起更新参数。
本文用大语言模型引导状态编码器的架构搜索,最终的状态表征由搜索得到的架构提供,而非大语言模型本身。
4.1 LACER:大语言模型→状态编码器→强化学习流程

本文方法LACER(面向强化学习复合状态编码器的大语言模型驱动 NAS)迭代执行:大语言模型生成候选状态编码器架构→在强化学习环境评估→将性能反馈给大语言模型。
4.1.1问题设定
考虑一个与环境交互的强化学习智能体,其观测由传感器、时序信号、文本指令、图像等多输入源组成。每个输入源需要不同类型的神经网络(MLP/FFN、Transformer、CNN、RNN)提取特征。
目标:自动发现一组架构模块(每个输入源对应一个)+ 一个融合模块,将各模块输出整合为最终隐状态表征。
形式化定义:设 x = ( x 1 , . . . , x M ) x=(x_1,...,x_M) x=(x1,...,xM) 为 M M M 个输入源的原始观测,整体状态编码器为:
s = g ϕ ( f θ 1 ( x 1 ) , . . . , f θ M ( x M ) ) s = g_{\phi}\left(f_{\theta_1}(x_1),...,f_{\theta_M}(x_M)\right) s=gϕ(fθ1(x1),...,fθM(xM))
其中 f θ i f_{\theta_i} fθi 为第 i i i 个源的神经模块, g ϕ g_{\phi} gϕ 为融合模块。目标是搜索设计参数 { θ i } i = 1 M \{\theta_i\}_{i=1}^M {θi}i=1M 与 ϕ \phi ϕ,最大化强化学习策略 π \pi π 在环境 E E E 中的性能 M ( ⋅ ; E ) \mathcal{M}(\cdot;E) M(⋅;E)(如平均车速、平均回报)。
与固定子函数的函数网络优化不同,本文子模块 f θ f_{\theta} fθ 本身是设计变量,改变 θ i \theta_i θi 会改变输入到输出与隐表征空间的映射,中间输出无法复用,增加了复杂度。
4.1.2大语言模型驱动的神经网络架构生成
从专家设计的初始架构出发,每一轮向大语言模型输入当前架构模块及其性能的简洁摘要,大语言模型生成一个或一批新的复合架构候选。
大语言模型在此作为神经网络架构设计智能体,根据已评估候选的反馈信号生成新模块配置。
每个模块(源专属编码器、融合模块)的搜索被限制在该类型网络的专用空间内:
图像输入:CNN
文本指令:GRU
时序输入:Transformer
向量输入:FFN
最后通过分词与模式匹配,将大语言模型输出转换为可执行架构。
大语言模型输出的是自然语言文字,计算机不能直接执行文字,必须变成代码 / 配置,所以要做两步:
分词:把句子拆成关键词,比如 “卷积”“两层”“全连接”“融合”。
模式匹配:按预设规则把这些词对应到真实的网络结构 / 代码模板,比如
“卷积” → Conv2d
“两层” → 堆叠两次
“融合” → concat 或 add
最终把自然语言描述 → 机器能跑的神经网络架构。
4.1.3强化学习训练与评估
每个生成的复合架构与强化学习智能体端到端联合训练(如 PPO),固定交互步数 T。
与现有 NAS 方法(如 GENIUS)不同,本文利用复合架构的中间输出,向大语言模型反馈任务指标、平均奖励、各源专属模块的特征信息(表征质量),作为辅助信号迭代优化架构。
强化学习策略架构固定,仅状态编码器模块在搜索中变化。大语言模型→训练→评估循环持续至耗尽评估预算。
5.方法学图示
5.1范式对比
与面向监督学习的传统神经网络架构搜索(NAS)方法不同,本文方法专为优化强化学习(RL)中的多源状态编码器而设计。
传统监督学习 NAS 范式:
神经网络架构 → \rightarrow → 黑盒函数(监督学习) → \rightarrow → 性能指标
本文多源 RL 状态编码复合 NAS 范式:
多源状态 → \rightarrow → 复合神经网络架构(RL 训练与评估) → \rightarrow → 黑盒函数 → \rightarrow → 性能指标
- 混合自动驾驶交通控制:交通状态、时序上下文、序列历史 → \rightarrow → FFN 与 Transformer 结构 → \rightarrow → 平均车速
- MiniGrid 面向目标任务:图像观测、文本指令 → \rightarrow → CNN 与 GRU 结构 → \rightarrow → 平均回报
平均回报是强化学习中衡量智能体表现的核心指标,指智能体在与环境交互过程中,累计获得的奖励总和除以交互次数 / 步数,直观反映智能体在任务中的收益水平。 - ManiSkill 机器人控制:RGB 观测、状态信息 → \rightarrow → CNN 与 FFN 结构 → \rightarrow → 成功率
5.2流程对比
相较于其他基于大语言模型(LLM)的 NAS 方法(如 GENIUS),本文方法在搜索 RL 状态编码器复合神经网络架构时,同时提升了采样效率与方案质量。
GENIUS 流程:
大型语言模型 → \rightarrow → 生成神经网络架构 → \rightarrow → 黑盒函数(监督学习) → \rightarrow → 验证精度 → \rightarrow → 更新置信度 → \rightarrow → 获取下一个输入
本文 LACER 流程:
大型语言模型 → \rightarrow → 生成架构建议 → \rightarrow → RL 训练与评估 → \rightarrow → 黑盒函数 → \rightarrow → 性能指标、表征质量、训练奖励 → \rightarrow → 更新置信度 → \rightarrow → 获取下一个输入
5.3性能信号
本文方法的性能信号包含三部分:
- 任务指标:混合自动驾驶交通控制场景下的平均车速,作为目标任务的最终衡量标准
- 平均奖励:因候选架构用于 RL 训练,将其作为反馈,表征收敛效率等关键 RL 特性
- 特征信息:通过互信息与冗余度量化,作为复合状态表征架构的表征质量直接度量
互信息:特征和原始数据相关性大不大(信息保留得多不多)
冗余度:不同特征之间重复信息多不 - 互信息公式:
I ( X ; Y ) = H ( X ) − H ( X ∣ Y ) I(X;Y) = H(X) - H(X\mid Y) I(X;Y)=H(X)−H(X∣Y)
衡量变量 X X X 与 Y Y Y 之间的依赖程度,值越高表示特征保留的原始信息越多。
冗余度公式:
R ( X ; Y ) = H ( X ) + H ( Y ) − H ( X , Y ) R(X;Y) = H(X) + H(Y) - H(X,Y) R(X;Y)=H(X)+H(Y)−H(X,Y)
衡量变量 X X X 与 Y Y Y 之间的信息重叠程度,值越低表示特征间冗余越少、表征更高效。
互信息计算:时间编码器处理前后的时间数据、交通编码器处理前后的交通数据、序列编码器处理前后的序列数据;融合编码器处理前后的各编码器特征与融合特征。
5.4提示词构建
本文方法所采用的迭代式提示词构建流程详见算法 1。对话历史 H H H 会经过策略性剪枝,仅保留核心信息 —— 包括初始架构、性能信号、任务描述与搜索空间定义,同时剔除冗余与非结构化内容。这一操作能够降低噪声,并缓解大语言模型在长交互过程中可能出现的遗忘问题。提示词中会明确区分不同角色:助手角色将大语言模型的响应记录到对话历史 H H H 中,系统角色与用户角色则分别提供配置信息与查询指令。初始用户提示词 u 0 u_0 u0 通过任务描述与结构化搜索空间建模,激活大语言模型的先验知识;而迭代提示词 U i U_i Ui 会强化搜索空间与约束条件,确保在多轮生成过程中保持鲁棒性。
-
初始化对话历史: H ← ∅ H \leftarrow \emptyset H←∅
清空对话历史,准备记录后续交互。 -
构建首次用户提示: U 0 ← D + X + a 0 + p 0 + R U_0 \leftarrow D + X + a_0 + p_0 + R U0←D+X+a0+p0+R
将任务描述 D D D、搜索空间 X X X、初始架构 a 0 a_0 a0、初始性能 p 0 p_0 p0、请求指令 R R R 拼接为第一轮用户输入,激活 LLM 先验知识。 -
构建完整提示词: Prompt 0 ← S + U 0 \text{Prompt}_0 \leftarrow S + U_0 Prompt0←S+U0
系统提示词 S S S + 首次用户提示词,形成 LLM 的完整输入。 -
LLM 生成首轮架构: L 1 ← LLM ( Prompt 0 ) L_1 \leftarrow \text{LLM}(\text{Prompt}_0) L1←LLM(Prompt0)
LLM 根据提示词生成第一批候选架构。 -
解析 LLM 响应: v ⃗ raw ← ParseLLMResponse ( L 1 ) \vec{v}_{\text{raw}} \leftarrow \text{ParseLLMResponse}(L_1) vraw←ParseLLMResponse(L1)(调用 Algorithm 2)
将 LLM 的自然语言输出解析为可实例化的架构参数向量。 -
记录首轮对话:将系统提示、用户提示、LLM 响应追加到对话历史 H H H。
-
迭代循环( i i i 从 1 1 1 到 N − 1 N-1 N−1):
-
\quad 构建后续用户提示: U i ← P i − 1 + X + R U_i \leftarrow P_{i-1} + X + R Ui←Pi−1+X+R
用上一轮架构的性能信号 P i − 1 P_{i-1} Pi−1、搜索空间 X X X、请求指令 R R R 拼接,强化约束与反馈。 -
\quad 构建迭代提示词: Prompt i ← H + U i \text{Prompt}_i \leftarrow H + U_i Prompti←H+Ui
对话历史 + 当前用户提示词,让 LLM 基于上下文迭代优化。 -
\quad LLM 生成本轮架构: L i + 1 ← LLM ( Prompt i ) L_{i+1} \leftarrow \text{LLM}(\text{Prompt}_i) Li+1←LLM(Prompti)
-
\quad 解析响应: v ⃗ raw ← ParseLLMResponse ( L i + 1 ) \vec{v}_{\text{raw}} \leftarrow \text{ParseLLMResponse}(L_{i+1}) vraw←ParseLLMResponse(Li+1)
-
\quad 记录本轮对话:将当前用户提示、LLM 响应追加到 H H H。
-
\quad RL 训练与评估:在 RL 框架中训练并评估本轮生成的所有架构,得到性能信号 P i P_i Pi,用于下一轮迭代。
-
循环结束:完成 N N N 次迭代,输出所有候选架构列表。
5.5大语言模型响应解析
通过指定前缀提取大语言模型输出的结构化文本块,经分词与正则表达式匹配,将自然语言输出解析为设计参数向量,直接实例化 RL 状态编码器。
输入:LLM 生成的响应文本 R R R、指定前缀字符串 P P P、正则表达式模式集合 P \mathcal{P} P(每个参数对应一个正则匹配规则)
输出:原始设计参数向量 v ⃗ raw \vec{v}_{\text{raw}} vraw
-
提取结构化文本块:通过 ExtractTextAfterPrefix \text{ExtractTextAfterPrefix} ExtractTextAfterPrefix 函数,从 LLM 响应 R R R 中提取前缀 P P P 之后的结构化输出内容,得到 text_block \text{text\_block} text_block。
-
分词处理:用 Tokenize \text{Tokenize} Tokenize 函数将 text_block \text{text\_block} text_block 切分成可处理的最小单元(如单词、数字等),得到 tokens \text{tokens} tokens。
-
初始化参数向量:创建一个空列表 v ⃗ raw \vec{v}_{\text{raw}} vraw,用于存储最终解析出的参数值。
-
正则匹配提取参数:遍历正则模式集合 P \mathcal{P} P 中的每一个模式 p i p_i pi:
用 ApplyRegex \text{ApplyRegex} ApplyRegex 函数将 p i p_i pi 与 tokens \text{tokens} tokens 进行匹配,提取对应的参数值 value \text{value} value。
将提取到的 value \text{value} value 追加到 v ⃗ raw \vec{v}_{\text{raw}} vraw 中。 -
返回结果:最终返回填充完成的原始参数向量 v ⃗ raw \vec{v}_{\text{raw}} vraw,可直接用于实例化 RL 状态编码器。
6.实验分析
6.1实验:基于强化学习的混合自动驾驶交通控制
6.1.1RL 状态编码器的复合架构设计
采用时间编码器、交通编码器、序列编码器分别处理对应数据,融合编码器处理拼接后的输出,为 RL 训练生成编码状态。所有模块基于 Transformer(时序数据表现优于 LSTM 等循环网络)与前馈网络(FFN)。时间与序列编码器加入多头自注意力(MHSA)以捕捉复杂时序动态,交通数据与融合编码器仅使用 FFN。
模块专属搜索空间
针对各模块功能与架构类型定义专属搜索空间,包含 Transformer 架构搜索常用参数:
FFN 模块:隐藏层维度、维度扩展比例、网络层数
含 MHSA 模块:额外增加注意力头数
仅 FFN 模块:额外增加激活函数类型
总搜索空间约包含 2600 万种可能架构
6.1.2基准环境
在联网自动驾驶车辆(CAV)与人类驾驶车辆共存的混合交通控制任务上评估,CAV 渗透率 0.9 0.9 0.9。每步观测包含三类输入源:
速度、密度、流量等关键指标的时序交通演化
当前交通状态(车道密度、速度分布、CAV 渗透率)
车辆序列分布历史
多源输入特性使其适合评估复合状态编码器。
6.1.3基线方法
三组基线:
- 专家设计:领域专家手动指定编码器架构
- 传统 NAS:DARTS、ENAS、PEPNAS,每轮生成 5 5 5 个候选
- 大语言模型 NAS:GENIUS(GPT‑4),每轮生成 1 1 1 个候选
6.1.4基线对齐
传统 NAS 方法(DARTS、ENAS、PEPNAS)原本面向图像分类等计算机视觉任务,应用于 RL 状态编码器搜索时需做适配:
性能指标:将精度替换为平均车速,DARTS 中验证性能对应的梯度映射为平均车速
样本量:PEPNAS 中每代候选验证样本量,对应为每代候选训练步数的递增
6.1.5强化学习训练与评估细节
强化学习训练需足够步数使策略收敛(以奖励为标志)。SUMO 模拟器中交通流为固定周期分布,平均车速呈周期性,评估需覆盖多个周期。
经分析,奖励在 20 万步左右收敛,车速周期约 2.5 万步。因此每个候选架构训练20 万步、评估5 万步。
6.1.6实验设置
采用四类编码器模块:交通编码器、时间编码器、序列编码器、融合编码器。
- 交通状态:固定维向量,用 FFN 处理
- 时序交通演化、动作序列历史:时序数据,用 Transformer 搜索
- 融合模块:FFN
每个候选架构用 PPO 训练 200 k 200\mathrm{k} 200k 交互步,评估 50 k 50\mathrm{k} 50k 步,获取平均车速、平均奖励、特征信息等指标。
本文方法设两种变体:
- LACER‑1:每轮生成 1 1 1 个候选
- LACER‑5:每轮生成 5 5 5 个候选
所有方法总评估候选数为 50 50 50,实验重复 8 8 8 个随机种子。
LLM 与温度参数选择
温度参数调控 LLM 输出随机性:值越高多样性越强,值越低确定性越高。
实验测试 Claude Sonnet 4.0、GPT-4 两种 LLM,温度 0.0 与 1.0 两种配置。结果显示:Claude Sonnet 4.0(温度 1.0) 表现最优,作为主实验配置。
评估指标
跟踪已评估最佳架构的平均交通车速随评估候选数的变化,衡量 NAS 采样效率(即快速发现高性能架构的能力)。
6.1.7实验结果

LACER 两种变体均显著优于专家设计、传统 NAS、GENIUS 基线。结果表明:
大语言模型先验 + + + 复合状态编码 + + + 丰富性能信号,可在强化学习场景下实现更采样高效的架构搜索。
6.1.8消融实验
验证核心模块必要性,分别移除三类关键提示组件:
- 特征信息(FI)
- 平均奖励(RI)
- 初始架构评估(IE)
结果显示:移除任一组件,LACER 性能明显下降,证明各组件均为必要且协同工作。
6.1.9时间成本分析
传统 NAS 时间成本 = = = 候选评估时间 + + + 每代搜索时间;
大语言模型 NAS 时间成本 = = = 大语言模型查询时间 + + + 候选结果分析与提示构建时间。
实验表明:
- 大语言模型查询时间占总时间约 1 % 1\% 1%
- 评估时间占所有方法总时间超 97 % 97\% 97%
查询时间对整体成本影响可忽略。
6.2MiniGrid 目标导向任务
状态编码器架构
参考 MiniGrid 环境设计,编码器包含图像编码器、文本编码器、融合编码器:
图像编码器:CNN + 池化层处理图像观测;
文本编码器:嵌入层 + 门控循环单元(GRU)表征文本指令;
融合编码器:拼接前两者输出,生成最终状态表征。
模块专属搜索空间
搜索空间约1900 万种架构,核心参数如下:
图像编码器(CNN + 池化):池化类型、池化层位置、激活函数、卷积核大小、通道数、深度;
文本编码器(嵌入 + GRU):嵌入维度、隐藏层大小、dropout 率、深度;
融合编码器:融合方式、网络维度、激活函数、隐藏层大小。
基线对齐
同交通控制任务,将传统 NAS 的精度替换为平均回报,样本量映射为训练步数递增。
强化学习训练与评估细节
经分析,重塑奖励在 100 万步收敛,评估回报在 100 步收敛。因此每个候选架构训练100 万步、评估100 步。


6.3ManiSkill 机器人控制
状态编码器架构
参考 ManiSkill 设计,编码器包含RGB 编码器(CNN+FFN)、信息编码器(FFN)、融合编码器,拼接二者输出生成编码状态。如图 12 所示。RGB 编码器采用结合前馈网络(FFNs)的卷积神经网络(CNNs)处理 RGB 观测值。信息编码器使用 FFNs 表征其他状态信息。融合编码器将图像编码器与文本编码器的处理后数据拼接,合并为最终表征作为状态。
7.个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。
如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理
更多推荐



所有评论(0)