别再让 AI 空谈“智能体研究方向“:我用 Open Science + CanguoAI 给 1181 篇 LLM Agent 论文画了一张文献地图
CanguoAI+Canguo Science 用于模型访问和结构化阅读,不负责生成论文数量、DOI 或研究结论。
1. 为什么"LLM Agent 有哪些方向"这类问答经常不靠谱?
大模型智能体(LLM Agent)是现在最火的方向之一。很多人会直接问模型:
帮我总结一下 LLM Agent 领域还有哪些可以发论文的创新点。
模型会很快给出一串词:多智能体协作、长期记忆、工具调用、规划推理、安全对齐……看上去都对。但只要继续追问,问题就来了:
- 一共检索了多少篇论文?
- 检索式和时间范围是什么?
- 哪些代表论文已经做过这些方向?
- 说"研究较少",到底少到什么程度?
- 换个人重新运行,能不能得到同一批数字?
大多数时候,这些问题没有可核对的答案。
研究方向不该是模型凭语言习惯拼出来的词。更稳妥的做法是:先用公开学术数据建立文献地图,再让 AI 帮忙阅读归纳,最后由研究者把候选方向转换成可以证伪的研究问题。
这次我用 LLM Agent 作为案例,因为它既是当下热点,也已经进入教育、金融、自动驾驶、智慧城市、物联网等落地场景。
2. 研究问题与数据边界
本文回答三个问题:
- 2020-2025 年,标题采用 "LLM agent" 表述的研究增长有多快?
- 这些记录主要分布在哪些 OpenAlex 主题和作者机构国家?
- 基准评测、规划、记忆、工具调用、多智能体、推理、安全和可复现性等维度,在标题中被明确讨论的比例有多高?
主检索式为:
display_name.search:"llm agent"
from_publication_date:2020-01-01
to_publication_date:2025-12-31
这里搜索的是标题,不是全文。因此这项研究测量的是相关概念在标题中的显式采用情况,不能声称覆盖全部智能体研究。
需要特别说明:"llm agent" 是 2023 年前后才被广泛使用的表述。很多更早的"自主智能体""LLM 驱动的对话系统"研究并不会在标题里写这个短语。所以本文测量的是这一特定术语的采用曲线,而不是"智能体研究从零开始"的历史。
"标题没有写 safety"也不代表论文正文完全没讨论安全。低频词只能用于筛选值得进一步系统综述的方向,不能直接证明研究空白存在。
3. 用 OpenAlex API 建立文献地图
获取年度数量的核心代码如下:
import json
import urllib.parse
import urllib.request
params = {
"filter": (
'display_name.search:"llm agent",'
"from_publication_date:2020-01-01,"
"to_publication_date:2025-12-31"
),
"group_by": "publication_year",
"per-page": 200,
}
url = "https://api.openalex.org/works?" + urllib.parse.urlencode(params)
request = urllib.request.Request(
url,
headers={"User-Agent": "OpenScience-CSDN-LLM-agent-review/1.0"},
)
with urllib.request.urlopen(request, timeout=60) as response:
result = json.load(response)
for row in sorted(result["group_by"], key=lambda item: int(item["key"])):
print(row["key"], row["count"])
本次快照得到 1181 条标题匹配记录:
| 年份 | 匹配记录数 |
|---|---|
| 2023 | 15 |
| 2024 | 251 |
| 2025 | 915 |
(2020-2022 年该标题短语匹配为 0,因此不在表中。)

这组数据有三个明显特征:
- 2025 年的 915 条占全部记录的 77.48%。
- 2024 与 2025 两年合计占 98.73%。
- 2025 年比 2024 年增加 264.54%,是 2023 年的 61 倍。
换句话说,"LLM Agent"作为一个标题级研究标签,几乎完全是一条 2024-2025 年的爆发曲线。它的主要挑战可能不是"论文太少",而是"文献在两年内暴涨,分类、评测和复现标准来不及统一"。
4. 主题分布:智能体已经不只是"对话+工具"
OpenAlex primary topic 的前几项如下:
| 主题 | 记录数 |
|---|---|
| Multi-Agent Systems and Negotiation | 143 |
| Topic Modeling | 101 |
| Semantic Web and Ontologies | 41 |
| Natural Language Processing Techniques | 33 |
| Multimodal Machine Learning Applications | 24 |
| Artificial Intelligence in Law | 23 |
| Business Process Modeling and Analysis | 21 |
| Adversarial Robustness in Machine Learning | 18 |
| Scientific Computing and Data Management | 18 |
| Network Security and Intrusion Detection | 16 |
这里需要谨慎解释。OpenAlex 的 primary topic 是算法生成的单一标签,并不等于研究者人工制定的分类体系。例如大量论文被归入 Topic Modeling,并不代表它们都在研究传统主题模型。

但这张图仍然提供了有用信号:排在第一的是"多智能体系统与协商",说明多智能体协作已经是这批文献的主线;同时法律、业务流程建模、多模态、对抗鲁棒性、网络安全入侵检测等主题也已出现。做综述时,不能只按"单体 Agent + 工具调用"组织章节,还要考虑智能体数量、协作结构、领域约束和安全目标。
作者机构国家分布方面,中国(127 篇)和美国(126 篇)几乎并列第一,其后是英国、中国香港、日本、澳大利亚、新加坡等。注意:国际合作论文会被同时计入多个国家,因此这些数字之间存在重叠。

5. 代表论文告诉我们:主线已经发展到哪一步?
为了避免只看数量,我同时提取了匹配记录中被引次数较高的论文。以下引用和 DOI 来自本次 OpenAlex 快照:
- ExpeL: LLM Agents Are Experiential Learners,AAAI 2024,DOI:
10.1609/aaai.v38i17.29936。 - Designing Heterogeneous LLM Agents for Financial Sentiment Analysis,2024,DOI:
10.1145/3688399。 - Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents,CVPR 2024,DOI:
10.1109/cvpr52733.2024.01428。 - LLM Agents for Education: Advances and Applications,EMNLP Findings 2025,DOI:
10.18653/v1/2025.findings-emnlp.743。 - On protecting the data privacy of Large Language Models (LLMs) and LLM agents: A literature review,2025,DOI:
10.1016/j.hcc.2025.100300。 - Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents,2023,DOI:
10.48550/arXiv.2306.03314。 - Evaluating Very Long-Term Conversational Memory of LLM Agents,ACL 2024,DOI:
10.18653/v1/2024.acl-long.747。
从这些代表工作可以看出,LLM Agent 的主线已经覆盖:
- 经验学习与自我提升;
- 领域落地(金融、自动驾驶、教育、智慧城市、物联网);
- 多智能体协作;
- 长期记忆评测;
- 数据隐私综述。
因此,"搭一个能调用工具的 Agent 并证明比裸 LLM 强"已经很难构成充分创新。新工作至少需要回答:在什么任务、什么失效条件、什么成本约束下,改进是稳定且可复现的?
6. 用同一检索口径筛选候选研究方向
我对主检索集合增加第二个标题词,例如:
"llm agent" AND safety
"llm agent" AND memory
"llm agent" AND reproducibility
Python 中可以循环查询:
terms = [
"benchmark", "evaluation", "planning", "memory", "tool",
"multi-agent", "reasoning", "safety", "security", "reproducibility",
]
for term in terms:
filters = (
'display_name.search:"llm agent",'
f"display_name.search:{term},"
"from_publication_date:2020-01-01,to_publication_date:2025-12-31"
)
# 请求 OpenAlex,并读取 meta.count
实测结果:
| 标题维度 | 记录数 | 占 1181 条比例 |
|---|---|---|
| multi-agent | 97 | 8.21% |
| evaluation | 76 | 6.44% |
| benchmark | 61 | 5.17% |
| reasoning | 55 | 4.66% |
| memory | 49 | 4.15% |
| tool | 48 | 4.06% |
| planning | 47 | 3.98% |
| security | 25 | 2.12% |
| safety | 16 | 1.35% |
| reproducibility | 1 | 0.08% |

再次强调:这些比例不是"领域真实研究占比",因为论文可能在正文讨论相关问题但标题没有对应词。它们的作用是帮我们决定下一轮应该精读和人工标注什么。
7. 从低覆盖词到 5 个可检验选题
方向一:多智能体协作的收益能否被稳定复现?
multi-agent 是覆盖最高的维度(97 条,8.21%),已经是研究热点而非空白。所以不能写成"尚无人研究"。更好的问题是收益的稳定性:
在相同任务和相同基座模型下,多智能体协作相比单智能体的提升,是否会随角色数量、通信轮数和提示词变化而消失?
实验需要报告任务成功率、Token 成本和方差,而不是只给一个最优配置下的准确率。
方向二:智能体长期记忆的评测标准
memory 有 49 条(4.15%),已有 ACL 2024 的长期对话记忆评测工作,说明这是活跃方向。可检验问题:
现有长期记忆基准在检索式记忆、参数式记忆和外部存储三类实现上,是否使用了可比的指标?跨会话的信息遗忘和冲突如何量化?
这类研究不一定要提出新模型,也可以建立统一的记忆评测协议。
方向三:智能体安全在标题层面覆盖偏低
safety(16 条,1.35%)和 security(25 条,2.12%)在标题层面覆盖较低,但网络安全入侵检测已进入主题前十。这是一个值得深挖的冲突关系:
当智能体被赋予工具调用和自主执行能力时,提示注入、越权操作和恶意工具返回会以多大概率导致有害动作?现有防护会损失多少任务成功率?
需要同时测量攻击成功率、任务完成率和防护开销。
方向四:规划与推理能力的可归因评测
planning(47 条)和 reasoning(55 条)都在中等覆盖区间。当前很多论文把"规划"和"推理"混在最终成功率里。可检验问题:
智能体的失败究竟来自规划错误、工具调用错误,还是最终推理错误?能否设计可分解归因的评测流程?
这比只报告端到端成功率更贴近工程诊断需求,也适合 IEEE 类论文。
方向五:智能体研究的可复现性
reproducibility 在标题中只有 1 条(0.08%)。智能体结果会受基座模型版本、工具集、提示词、随机性和执行环境共同影响。
可检验问题:
当只固定基座模型版本或只固定工具集时,公开智能体基准的排名是否稳定?论文是否提供了足够信息让第三方复现?
这类研究可以建立智能体配置披露清单和可重复基准,是当前爆发式增长下最容易被忽视、却最有价值的方向之一。
8. CanguoAI 在文献综述里怎么用才稳妥?
在这套流程中,Open Science 负责保存检索式、原始响应、统计代码、图表和研究记录;CanguoAI 作为模型访问层,用于执行需要语言理解的任务:
- 把论文按"协作结构、记忆、工具、评测、安全"制作结构化卡片;
- 从摘要中抽取数据集、模型、指标和限制;
- 对多篇论文的实验设置做横向比较;
- 将候选方向改写成可证伪假设;
- 生成 SCI/IEEE 风格的 related work 初稿;
- 检查正文数字是否与
results.json一致。
建议把真实元数据随提示词一起发送,并禁止模型补造:
prompt = f"""
下面是来自 OpenAlex 的真实论文元数据。
只能引用输入中存在的标题、年份和 DOI,不得补造文献。
任务:
1. 按协作结构、记忆、工具、评测和安全分类;
2. 每个候选方向必须给出支持证据和反证;
3. 将"研究较少"写成待验证假设,不得写成确定事实;
4. 输出适合人工复核的 Markdown 表格。
DATA:
{json.dumps(openalex_records, ensure_ascii=False)}
"""
如果使用 CanguoAI 提供的兼容接口,应从控制台读取实际 API 根地址、密钥和模型名,不要在公开代码中写入密钥。
9. 完整复现
项目文件包括:
data_contract.md 数据来源与解释边界
study.py 抓取、统计、验证和绘图
raw/*.json 每次 OpenAlex 原始响应
data.json 结构化文献地图
results.json 带时间戳的实测结果
figures/ PNG、PDF、SVG 图表
运行:
cd output/experiment-suite/llm-agent-landscape/latest
python -m pip install -r requirements.txt
python study.py

10. 总结
本次真实数据分析显示,标题采用 "LLM agent" 表述的 1181 条 OpenAlex 记录中,98.73% 集中在 2024-2025 年,2025 年一年就占 77.48%。领域已经快速扩展到多智能体协作、法律、业务流程、多模态和网络安全等方向,但标题层面对安全、可复现性等维度的显式覆盖相对有限。
更重要的是,我们没有直接把"低频"写成"空白",而是把它转换成下一轮系统检索、人工标注和对照实验的候选问题。
这正是 Open Science + CanguoAI 组合更适合科研的使用方式:
Open Science 管证据和复现,CanguoAI 管语言理解与模型访问,研究者对检索边界、实验设计和最终结论负责。
CanguoAI:CanguoAI · AI 大模型 API 聚合中转服务
利益关系说明:本文作者与 CanguoAI 项目有关联。文中的论文数量、主题、国家和 DOI 来自 OpenAlex 公开数据,不是产品内部统计;本文也没有进行 CanguoAI 与其他模型服务的效果对照实验。
参考文献
[1] Zhao A, et al. ExpeL: LLM Agents Are Experiential Learners. AAAI, 2024. DOI: 10.1609/aaai.v38i17.29936.
[2] Xing F. Designing Heterogeneous LLM Agents for Financial Sentiment Analysis. ACM TMIS, 2024. DOI: 10.1145/3688399.
[3] Wei Y, et al. Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents. CVPR, 2024. DOI: 10.1109/cvpr52733.2024.01428.
[4] Maytin M, et al. Evaluating Very Long-Term Conversational Memory of LLM Agents. ACL, 2024. DOI: 10.18653/v1/2024.acl-long.747.
[5] Talebirad Y, Nadiri A. Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents. arXiv:2306.03314, 2023. DOI: 10.48550/arXiv.2306.03314.
更多推荐


所有评论(0)