搜广推进入 Agent 时代
腾讯 AdPilot 全自动广告投放智能体和快手 AgentX 自进化推荐研发闭环,在同一时间窗口释放同一个信号:搜广推的范式正在从"人写规则、模型拟合"转向"Agent 自主决策、自我迭代"。
为什么是现在?
搜广推过去十年的主线是把模型做大、把特征做细。但两个瓶颈始终没被解决:
执行瓶颈:广告投手手动调参、算法工程师手工推进实验——人的吞吐量线性限制了系统迭代速度。一个工程师只能串行推进 1-2 个实验,一个投手能同时管理的广告计划数有硬上限。
经验瓶颈:失败实验的价值只停留在文档和个人记忆里,无法转化为系统能力。下一个投手/工程师仍然可能重复踩坑。
两个瓶颈指向同一个答案:让 Agent 成为执行主体,人退到监督位。
腾讯 AdPilot(KDD 2026)和快手 AgentX(2026.06 技术报告)分别从广告投放和推荐研发两条线,给出了工程验证过的解法。(PS 下面这两个图不出意外也是大模型画的🐶)


AdPilot:广告投放从"人工操盘"到"Agent 自主决策"
AdPilot 是腾讯广告技术团队提出的首个端到端全自动广告投放智能体,已部署在腾讯营销智能投放平台 AIM+。核心思路:把广告投放建模为 MDP,用 LLM 做推理引擎,用 RL 做端到端优化。

三模块架构
| 模块 | 做什么 | 关键设计 |
|---|---|---|
| 记忆与反思 | 让 Agent 记住投放历史 | 短期记忆用结构化表格(比非结构化省 40% token);长期记忆按天做 LLM 摘要压缩;Reflector 每小时主动诊断异常 |
| 推理增强 | 把广告领域知识喂给模型 | 用 Qwen3-235B-Thinking 大规模 few-shot 生成推理数据;"Rubrics as Rewards"打分 + 拒绝采样保证质量 |
| 强化学习 | 直接优化业务目标 | GRPO 训练(参照 DeepSeek-R1 思路);自研广告环境模拟器(95% 反馈准确率);奖励 = 格式 + 推理 + 业务结果 |
关键结果
- 32B 参数模型,AdBench 综合得分超过 235B 模型 6.5%,超过 Gemini-3-Pro 4.3%
- 通用大模型推理得分高(77.3%)但业务得分低(50.2%)——“会推理"不等于"会决策”
- 消融实验:去掉记忆模块业务得分 -8.89%,去掉推理增强推理得分 -16.32%,去掉 RL 训练综合得分 -11.76%
AdPilot 证明的核心命题:领域对齐的小模型可以超越通用大模型。推理能力是必要条件,但不是充分条件——领域知识、记忆机制和 RL 对齐才是业务决策能力的关键。
AgentX:推荐研发从"人力线性推进"到"Agent 批量自进化"
AgentX 是快手技术团队提出的Agent 驱动的推荐系统自我迭代闭环。它不满足于让 Agent 做代码补全,而是让 Agent 成为推荐研发的执行主体:生成方案、写代码、上线实验、读反馈、沉淀经验。

四阶段闭环
- Brainstorm Agent:模糊目标 → 可落地方案。综合历史实验、系统架构、数据分析、外部论文,把想法收敛为有优先级、有证据、有边界的候选方案。
- Developing Agent:方案 → 生产代码。通过仓库知识库、特征 schema 查询、DSL/语法检查、dryrun 验证,让代码生成约束在真实工程规则内。
- Evaluation Agent:线上 A/B → 可复用的经验资产。安全部署、流量分桶、指标读取、guardrail veto。成功实验变成 playbook,失败实验沉淀为反例和约束。
- Harness Evolution:轨迹数据 → Agent 工作方式改进。SGPO(Semantic-Gradient-based Prompt Optimization)从历史执行中找出 Agent 自身缺陷,自动更新子 Agent 的 prompt。
关键结果
在快手 App 真实部署,3 个 AgentX worker:
- 374 个想法 → 106 个通过方案审核 → 100 个完成上线 → 10 个可发布结果
- 单 worker 并发实验数 8x(12 vs 1.5),单 worker 周产出可发布结果 13.8x
- 单位人力业务价值 3.7x
- 主站 App 消费时长累计 +0.561%,生活服务年化收入 超 1 亿元
- 自我加速:周并发实验 15→60,idea 通过率 15%→45%,周可发布结果 2→5
AgentX 证明的核心命题:Agent 的经验可以复利。传统研发中每次实验的投入在新实验开始时清零;AgentX 把每次执行轨迹转化为后续方案生成、代码实现和 harness 优化的燃料——系统越跑越快。
两条线的交汇:Agent 时代的三个范式迁移
AdPilot(广告投放)和 AgentX(推荐研发)虽然落地场景不同,但底层逻辑高度一致:
1. 从 Human-in-the-Loop 到 Human-on-the-Loop
AdPilot 把投手从"每步都要操作"解放为"设定目标、监督异常";AgentX 把工程师从"每个实验手工推进"解放为"设定方向、审核关键节点"。人的角色从执行者变成监督者。
2. LLM 不是万能的,但 LLM + 领域对齐 + 真实反馈是
两个系统都证明:裸 LLM 的通用推理能力不足以解决搜广推的决策问题。但 LLM 作为推理引擎,叠加上领域知识(推理增强/系统知识库)、记忆机制(短期+长期/Harness Evolution)和真实环境反馈(RL/A-B 实验),就能产生超出纯人工和纯模型的决策质量。
3. 经验不再是"人的经验",而是"系统的记忆"
传统搜广推的知识积累靠文档、靠人脑、靠口口相传。AdPilot 的两层记忆和 AgentX 的实验知识库都在做同一件事:把过程数据资产化。每一次决策、每一次实验结果、每一次诊断反思,都变成系统能力而非个人经验。
一个值得关注的信号
AdPilot 32B 模型在广告决策上超过 235B 通用模型这个结果,与 AgentX "用 Agent 调度现有工具链做推荐研发"的思路在底层呼应:Agent 时代的竞争力不在于模型参数规模,而在于领域知识密度、闭环反馈效率和经验复利速度。
这可能是搜广推接下来最重要的技术趋势:不是继续卷模型大小,而是卷"Agent 系统设计"——记忆怎么组织、推理怎么增强、反馈怎么回环、知识怎么积累。
来源备注
更多推荐


所有评论(0)