CanguoAI+Canguo Science 用于模型访问和结构化阅读,不负责生成论文数量、DOI 或研究结论。

1. 为什么"LLM Agent 有哪些方向"这类问答经常不靠谱?

大模型智能体(LLM Agent)是现在最火的方向之一。很多人会直接问模型:

帮我总结一下 LLM Agent 领域还有哪些可以发论文的创新点。

模型会很快给出一串词:多智能体协作、长期记忆、工具调用、规划推理、安全对齐……看上去都对。但只要继续追问,问题就来了:

  • 一共检索了多少篇论文?
  • 检索式和时间范围是什么?
  • 哪些代表论文已经做过这些方向?
  • 说"研究较少",到底少到什么程度?
  • 换个人重新运行,能不能得到同一批数字?

大多数时候,这些问题没有可核对的答案。

研究方向不该是模型凭语言习惯拼出来的词。更稳妥的做法是:先用公开学术数据建立文献地图,再让 AI 帮忙阅读归纳,最后由研究者把候选方向转换成可以证伪的研究问题。

这次我用 LLM Agent 作为案例,因为它既是当下热点,也已经进入教育、金融、自动驾驶、智慧城市、物联网等落地场景。

2. 研究问题与数据边界

本文回答三个问题:

  1. 2020-2025 年,标题采用 "LLM agent" 表述的研究增长有多快?
  2. 这些记录主要分布在哪些 OpenAlex 主题和作者机构国家?
  3. 基准评测、规划、记忆、工具调用、多智能体、推理、安全和可复现性等维度,在标题中被明确讨论的比例有多高?

主检索式为:

display_name.search:"llm agent"
from_publication_date:2020-01-01
to_publication_date:2025-12-31

这里搜索的是标题,不是全文。因此这项研究测量的是相关概念在标题中的显式采用情况,不能声称覆盖全部智能体研究。

需要特别说明:"llm agent" 是 2023 年前后才被广泛使用的表述。很多更早的"自主智能体""LLM 驱动的对话系统"研究并不会在标题里写这个短语。所以本文测量的是这一特定术语的采用曲线,而不是"智能体研究从零开始"的历史。

"标题没有写 safety"也不代表论文正文完全没讨论安全。低频词只能用于筛选值得进一步系统综述的方向,不能直接证明研究空白存在。

3. 用 OpenAlex API 建立文献地图

获取年度数量的核心代码如下:

import json
import urllib.parse
import urllib.request

params = {
    "filter": (
        'display_name.search:"llm agent",'
        "from_publication_date:2020-01-01,"
        "to_publication_date:2025-12-31"
    ),
    "group_by": "publication_year",
    "per-page": 200,
}

url = "https://api.openalex.org/works?" + urllib.parse.urlencode(params)
request = urllib.request.Request(
    url,
    headers={"User-Agent": "OpenScience-CSDN-LLM-agent-review/1.0"},
)

with urllib.request.urlopen(request, timeout=60) as response:
    result = json.load(response)

for row in sorted(result["group_by"], key=lambda item: int(item["key"])):
    print(row["key"], row["count"])

本次快照得到 1181 条标题匹配记录:

年份 匹配记录数
2023 15
2024 251
2025 915

(2020-2022 年该标题短语匹配为 0,因此不在表中。)

这组数据有三个明显特征:

  1. 2025 年的 915 条占全部记录的 77.48%
  2. 2024 与 2025 两年合计占 98.73%
  3. 2025 年比 2024 年增加 264.54%,是 2023 年的 61 倍

换句话说,"LLM Agent"作为一个标题级研究标签,几乎完全是一条 2024-2025 年的爆发曲线。它的主要挑战可能不是"论文太少",而是"文献在两年内暴涨,分类、评测和复现标准来不及统一"。

4. 主题分布:智能体已经不只是"对话+工具"

OpenAlex primary topic 的前几项如下:

主题 记录数
Multi-Agent Systems and Negotiation 143
Topic Modeling 101
Semantic Web and Ontologies 41
Natural Language Processing Techniques 33
Multimodal Machine Learning Applications 24
Artificial Intelligence in Law 23
Business Process Modeling and Analysis 21
Adversarial Robustness in Machine Learning 18
Scientific Computing and Data Management 18
Network Security and Intrusion Detection 16

这里需要谨慎解释。OpenAlex 的 primary topic 是算法生成的单一标签,并不等于研究者人工制定的分类体系。例如大量论文被归入 Topic Modeling,并不代表它们都在研究传统主题模型。

但这张图仍然提供了有用信号:排在第一的是"多智能体系统与协商",说明多智能体协作已经是这批文献的主线;同时法律、业务流程建模、多模态、对抗鲁棒性、网络安全入侵检测等主题也已出现。做综述时,不能只按"单体 Agent + 工具调用"组织章节,还要考虑智能体数量、协作结构、领域约束和安全目标。

作者机构国家分布方面,中国(127 篇)和美国(126 篇)几乎并列第一,其后是英国、中国香港、日本、澳大利亚、新加坡等。注意:国际合作论文会被同时计入多个国家,因此这些数字之间存在重叠。

5. 代表论文告诉我们:主线已经发展到哪一步?

为了避免只看数量,我同时提取了匹配记录中被引次数较高的论文。以下引用和 DOI 来自本次 OpenAlex 快照:

  1. ExpeL: LLM Agents Are Experiential Learners,AAAI 2024,DOI:10.1609/aaai.v38i17.29936
  2. Designing Heterogeneous LLM Agents for Financial Sentiment Analysis,2024,DOI:10.1145/3688399
  3. Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents,CVPR 2024,DOI:10.1109/cvpr52733.2024.01428
  4. LLM Agents for Education: Advances and Applications,EMNLP Findings 2025,DOI:10.18653/v1/2025.findings-emnlp.743
  5. On protecting the data privacy of Large Language Models (LLMs) and LLM agents: A literature review,2025,DOI:10.1016/j.hcc.2025.100300
  6. Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents,2023,DOI:10.48550/arXiv.2306.03314
  7. Evaluating Very Long-Term Conversational Memory of LLM Agents,ACL 2024,DOI:10.18653/v1/2024.acl-long.747

从这些代表工作可以看出,LLM Agent 的主线已经覆盖:

  • 经验学习与自我提升;
  • 领域落地(金融、自动驾驶、教育、智慧城市、物联网);
  • 多智能体协作;
  • 长期记忆评测;
  • 数据隐私综述。

因此,"搭一个能调用工具的 Agent 并证明比裸 LLM 强"已经很难构成充分创新。新工作至少需要回答:在什么任务、什么失效条件、什么成本约束下,改进是稳定且可复现的?

6. 用同一检索口径筛选候选研究方向

我对主检索集合增加第二个标题词,例如:

"llm agent" AND safety
"llm agent" AND memory
"llm agent" AND reproducibility

Python 中可以循环查询:

terms = [
    "benchmark", "evaluation", "planning", "memory", "tool",
    "multi-agent", "reasoning", "safety", "security", "reproducibility",
]

for term in terms:
    filters = (
        'display_name.search:"llm agent",'
        f"display_name.search:{term},"
        "from_publication_date:2020-01-01,to_publication_date:2025-12-31"
    )
    # 请求 OpenAlex,并读取 meta.count

实测结果:

标题维度 记录数 占 1181 条比例
multi-agent 97 8.21%
evaluation 76 6.44%
benchmark 61 5.17%
reasoning 55 4.66%
memory 49 4.15%
tool 48 4.06%
planning 47 3.98%
security 25 2.12%
safety 16 1.35%
reproducibility 1 0.08%

再次强调:这些比例不是"领域真实研究占比",因为论文可能在正文讨论相关问题但标题没有对应词。它们的作用是帮我们决定下一轮应该精读和人工标注什么。

7. 从低覆盖词到 5 个可检验选题

方向一:多智能体协作的收益能否被稳定复现?

multi-agent 是覆盖最高的维度(97 条,8.21%),已经是研究热点而非空白。所以不能写成"尚无人研究"。更好的问题是收益的稳定性

在相同任务和相同基座模型下,多智能体协作相比单智能体的提升,是否会随角色数量、通信轮数和提示词变化而消失?

实验需要报告任务成功率、Token 成本和方差,而不是只给一个最优配置下的准确率。

方向二:智能体长期记忆的评测标准

memory 有 49 条(4.15%),已有 ACL 2024 的长期对话记忆评测工作,说明这是活跃方向。可检验问题:

现有长期记忆基准在检索式记忆、参数式记忆和外部存储三类实现上,是否使用了可比的指标?跨会话的信息遗忘和冲突如何量化?

这类研究不一定要提出新模型,也可以建立统一的记忆评测协议。

方向三:智能体安全在标题层面覆盖偏低

safety(16 条,1.35%)和 security(25 条,2.12%)在标题层面覆盖较低,但网络安全入侵检测已进入主题前十。这是一个值得深挖的冲突关系

当智能体被赋予工具调用和自主执行能力时,提示注入、越权操作和恶意工具返回会以多大概率导致有害动作?现有防护会损失多少任务成功率?

需要同时测量攻击成功率、任务完成率和防护开销。

方向四:规划与推理能力的可归因评测

planning(47 条)和 reasoning(55 条)都在中等覆盖区间。当前很多论文把"规划"和"推理"混在最终成功率里。可检验问题:

智能体的失败究竟来自规划错误、工具调用错误,还是最终推理错误?能否设计可分解归因的评测流程?

这比只报告端到端成功率更贴近工程诊断需求,也适合 IEEE 类论文。

方向五:智能体研究的可复现性

reproducibility 在标题中只有 1 条(0.08%)。智能体结果会受基座模型版本、工具集、提示词、随机性和执行环境共同影响。

可检验问题:

当只固定基座模型版本或只固定工具集时,公开智能体基准的排名是否稳定?论文是否提供了足够信息让第三方复现?

这类研究可以建立智能体配置披露清单和可重复基准,是当前爆发式增长下最容易被忽视、却最有价值的方向之一。

8. CanguoAI 在文献综述里怎么用才稳妥?

在这套流程中,Open Science 负责保存检索式、原始响应、统计代码、图表和研究记录;CanguoAI 作为模型访问层,用于执行需要语言理解的任务:

  • 把论文按"协作结构、记忆、工具、评测、安全"制作结构化卡片;
  • 从摘要中抽取数据集、模型、指标和限制;
  • 对多篇论文的实验设置做横向比较;
  • 将候选方向改写成可证伪假设;
  • 生成 SCI/IEEE 风格的 related work 初稿;
  • 检查正文数字是否与 results.json 一致。

建议把真实元数据随提示词一起发送,并禁止模型补造:

prompt = f"""
下面是来自 OpenAlex 的真实论文元数据。
只能引用输入中存在的标题、年份和 DOI,不得补造文献。

任务:
1. 按协作结构、记忆、工具、评测和安全分类;
2. 每个候选方向必须给出支持证据和反证;
3. 将"研究较少"写成待验证假设,不得写成确定事实;
4. 输出适合人工复核的 Markdown 表格。

DATA:
{json.dumps(openalex_records, ensure_ascii=False)}
"""

如果使用 CanguoAI 提供的兼容接口,应从控制台读取实际 API 根地址、密钥和模型名,不要在公开代码中写入密钥。

9. 完整复现

项目文件包括:

data_contract.md   数据来源与解释边界
study.py           抓取、统计、验证和绘图
raw/*.json         每次 OpenAlex 原始响应
data.json          结构化文献地图
results.json       带时间戳的实测结果
figures/           PNG、PDF、SVG 图表

运行:

cd output/experiment-suite/llm-agent-landscape/latest
python -m pip install -r requirements.txt
python study.py

10. 总结

本次真实数据分析显示,标题采用 "LLM agent" 表述的 1181 条 OpenAlex 记录中,98.73% 集中在 2024-2025 年,2025 年一年就占 77.48%。领域已经快速扩展到多智能体协作、法律、业务流程、多模态和网络安全等方向,但标题层面对安全、可复现性等维度的显式覆盖相对有限。

更重要的是,我们没有直接把"低频"写成"空白",而是把它转换成下一轮系统检索、人工标注和对照实验的候选问题。

这正是 Open Science + CanguoAI 组合更适合科研的使用方式:

Open Science 管证据和复现,CanguoAI 管语言理解与模型访问,研究者对检索边界、实验设计和最终结论负责。

CanguoAI:CanguoAI · AI 大模型 API 聚合中转服务

利益关系说明:本文作者与 CanguoAI 项目有关联。文中的论文数量、主题、国家和 DOI 来自 OpenAlex 公开数据,不是产品内部统计;本文也没有进行 CanguoAI 与其他模型服务的效果对照实验。

参考文献

[1] Zhao A, et al. ExpeL: LLM Agents Are Experiential Learners. AAAI, 2024. DOI: 10.1609/aaai.v38i17.29936.
[2] Xing F. Designing Heterogeneous LLM Agents for Financial Sentiment Analysis. ACM TMIS, 2024. DOI: 10.1145/3688399.
[3] Wei Y, et al. Editable Scene Simulation for Autonomous Driving via Collaborative LLM-Agents. CVPR, 2024. DOI: 10.1109/cvpr52733.2024.01428.
[4] Maytin M, et al. Evaluating Very Long-Term Conversational Memory of LLM Agents. ACL, 2024. DOI: 10.18653/v1/2024.acl-long.747.
[5] Talebirad Y, Nadiri A. Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents. arXiv:2306.03314, 2023. DOI: 10.48550/arXiv.2306.03314.

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐