在这里插入图片描述

网罗开发 (小红书、快手、视频号同名)

  大家好,我是 展菲,目前在上市企业从事人工智能项目研发管理工作,平时热衷于分享各种编程领域的软硬技能知识以及前沿技术,包括iOS、前端、Harmony OS、Java、Python等方向。在移动端开发、鸿蒙开发、物联网、嵌入式、云原生、开源等领域有深厚造诣。

图书作者:《ESP32-C3 物联网工程开发实战》
图书作者:《SwiftUI 入门,进阶与实战》
超级个体:COC上海社区主理人
特约讲师:大学讲师,谷歌亚马逊分享嘉宾
科技博主:华为HDE/HDG

我的博客内容涵盖广泛,主要分享技术教程、Bug解决方案、开发工具使用、前沿科技资讯、产品评测与使用体验。我特别关注云服务产品评测、AI 产品对比、开发板性能测试以及技术报告,同时也会提供产品优缺点分析、横向对比,并分享技术沙龙与行业大会的参会体验。我的目标是为读者提供有深度、有实用价值的技术洞察与分析。

展菲:您的前沿技术领航员
👋 大家好,我是展菲!
📱 全网搜索“展菲”,即可纵览我在各大平台的知识足迹。
每周定时推送干货满满的技术长文,从新兴框架的剖析到运维实战的复盘,助您技术进阶之路畅通无阻。


引言:当 AI Agent 从“助手”变成“数字员工”

过去一年,AI Agent 成为了大模型应用领域最热门的方向。

从最开始的:

ChatBot

到现在:

AI Coding Agent

Research Agent

Customer Service Agent

Data Analysis Agent

AI 正在发生一个明显变化,以前我们关注:

AI 能不能回答问题?

现在我们关注:

AI 能不能独立完成任务?

例如,用户告诉 AI:

“帮我分析最近三个月销售数据,并给出下一季度销售策略。”

一个真正的 Agent 系统可能会自动:

获取数据

↓

清洗数据

↓

分析趋势

↓

生成报告

↓

提出建议

整个过程已经不是一次模型调用,而是:

多个 Agent
+
多个工具
+
多个任务

协同完成。

但是,当 Agent 数量不断增加,一个新的问题出现了,如果企业未来拥有:

100 个 Agent

10000 个 Agent

甚至 100 万个 Agent

系统如何管理?例如:

  • 哪个 Agent 优先执行?
  • 哪些任务需要大模型?
  • 哪些任务可以使用小模型?
  • 如何避免多个 Agent 抢占 GPU?
  • 一个长时间运行的 Agent 如何保存状态?

这些问题,本质上已经不是模型问题。而是:

分布式系统调度问题。

这也是 Agent Scheduler 出现的原因。

一、为什么传统任务调度方式无法满足 Agent?

很多开发者第一眼看到 Agent Scheduler,会想到:

Kubernetes Scheduler

确实,两者有很多相似点。

Kubernetes 调度:

Container

Agent Scheduler 调度:

Agent Task

但是两者最大的区别,Agent 不是一个简单任务。

传统服务:

Request

↓

Service

↓

Response

生命周期:

毫秒级

例如:

一个 HTTP 请求:

查询用户信息

执行结束:

数据库查询

返回结果

而 Agent 更像一个长期运行的任务,例如:

用户目标

↓

任务规划

↓

调用工具

↓

观察结果

↓

调整策略

↓

继续执行

↓

输出结果

整个过程,可能持续:

几秒

几分钟

甚至几个小时

在这里插入图片描述

二、Agent Scheduler 调度的不是计算,而是智能任务

传统 Scheduler 关注:

CPU

Memory

Network

Container

但是 Agent 系统需要管理:

Agent

Task

Model

Tool

Memory

Context

一个 Agent Task 通常包含:

{
  "goal": "修复支付模块Bug",
  "priority": "high",
  "model": "Large LLM",
  "tools": [
      "Git",
      "Terminal",
      "Database"
  ],
  "deadline": "10min"
}

Scheduler 需要决定:

什么时候执行?

运行在哪个节点?

使用哪个模型?

分配多少资源?

这和传统任务调度最大的区别:

Agent 调度的是目标,而不是单纯的计算任务。

三、Agent Scheduler 更像 AI 时代的操作系统

如果把传统计算机抽象:

Application

↓

Operating System

↓

Hardware

那么未来 AI 系统可能变成:

AI Application

↓

Agent Runtime

↓

Agent Scheduler

↓

Inference Runtime

↓

GPU/NPU

其中Agent Scheduler 的角色,非常类似操作系统中的:

Process Scheduler

Linux 调度:

哪个进程获得 CPU 时间

Agent Scheduler 调度:

哪个 Agent 获得 AI 计算资源

AI Agent系统分层架构图

在这里插入图片描述

四、百万级 Agent 最大的问题:资源竞争

假设一个企业内部运行:

100万个 Agent

同时工作,例如:

客服 Agent

销售 Agent

研发 Agent

数据分析 Agent

所有 Agent 都需要:

LLM推理

Memory

工具调用

知识库访问

问题马上出现,GPU 是有限的,显存也是有限的。

如果没有调度,可能出现:

某个 Agent

↓

大量调用大模型

↓

GPU 被占满

↓

其他 Agent 无法运行

这和服务器中:

某个服务 CPU 打满

非常类似。

因此 Agent Scheduler 必须具备:

Resource Isolation(资源隔离)

例如,研发 Agent:

GPU quota: 40%

客服 Agent:

GPU quota: 30%

数据分析 Agent:

GPU quota: 30%

避免单个 Agent 影响整个系统。

五、Agent 调度最大的难点:任务是不确定的

普通任务,通常是固定流程:

A

↓

B

↓

C

但是 Agent 不一样,它可能根据执行结果动态产生任务。

例如,用户:

“开发一个电商系统。”

Planner Agent 拆解:

Frontend Agent

Backend Agent

Database Agent

Test Agent

执行过程中 Backend Agent 发现,需要支付模块。

于是新增:

Payment Agent

这意味着 Agent Scheduler 面对的是:

Dynamic Task Graph

动态任务图:
在这里插入图片描述

六、模型选择也是 Scheduler 的重要职责

未来不会所有任务都使用最大模型,这是一个非常重要的变化。

例如,简单任务:

邮件总结

文本分类

数据整理

使用:

Small Model

复杂任务:

系统设计

代码重构

复杂分析

使用:

Large Model

因此 Scheduler 需要具备:

Model Routing

模型路由能力,流程:

Task

↓

判断复杂度

↓

选择模型

例如:

简单任务
   |
Small LLM


复杂任务
   |
Large LLM

目的降低:

Cost / Token

提升:

System Throughput

七、Agent Memory 让调度问题更加复杂

普通服务,状态通常在:

Database

但是 Agent 状态包括:

历史任务

上下文

工具结果

中间状态

长期记忆

例如一个 Coding Agent 运行两个小时。

它可能保存:

修改过的文件

执行过的命令

错误日志

解决方案

这些都是:

Agent State

如果 Agent 被迁移 Scheduler 必须支持:

State Migration

类似虚拟机迁移。

未来可能出现:

Agent Checkpoint

保存:

Agent当前状态

↓

迁移

↓

继续执行

八、Agent Scheduler 与 Kubernetes 会融合吗?

这是目前非常值得关注的方向。

Kubernetes 解决:

计算资源调度

Agent Scheduler 解决:

智能任务调度

未来架构可能:

Agent Scheduler

↓

Kubernetes

↓

GPU Cluster

Kubernetes 管:

  • Pod
  • Node
  • GPU资源

Agent Scheduler 管:

  • Agent生命周期
  • Task Graph
  • Model选择
  • Context管理

两者职责不同。

九、未来 AI Infra 的核心架构

未来 AI 系统可能形成:

用户

↓

AI Application

↓

Agent Runtime

↓

Agent Scheduler

↓

Inference Runtime

↓

GPU Cluster

其中 Agent Runtime 负责:

思考

规划

工具调用

Agent Scheduler 负责:

调度

资源分配

任务管理

Inference Runtime 负责:

模型执行

KV Cache

Batch优化

十、未来竞争不是拥有多少 Agent,而是管理多少 Agent

未来企业可能都会拥有:

大量 AI Agent

但是 Agent 数量并不是核心。

真正重要的是系统是否能够:

  • 高效调度
  • 控制成本
  • 管理状态
  • 保证稳定性

类似互联网时代竞争:

服务器规模

云计算时代竞争:

资源利用率

AI Agent 时代竞争:

智能体调度效率

总结:Agent Scheduler 是 AI 时代的新调度层

过去计算机时代:

CPU Scheduler

云计算时代:

Container Scheduler

未来 AI Agent 时代:

Agent Scheduler

一句话总结:

未来 AI 最大的问题,不是如何创建更多 Agent,而是如何让百万级 Agent 高效运行。

未来 AI 基础设施架构:

Model

↓

Inference Runtime

↓

Agent Runtime

↓

Agent Scheduler

↓

Autonomous System

模型决定智能上限,Runtime 决定执行能力。而 Scheduler 决定:

这些智能体能不能真正规模化运行。

当 AI 从一个聊天助手变成百万级数字员工之后,真正重要的问题已经不是:

“AI 能不能思考?”

而是:“谁能够管理这些 AI 的思考过程?”

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐