前面几篇,我们一直在解决一个问题:

如何让 AI 从聊天助手,变成一个真正参与工作的系统。

我们给 Hermes 加了:

  • Gateway,让任务可以主动进入;

  • Cron,让任务可以定时触发;

  • Kanban,让任务有状态、有记录;

  • Profile,让不同 Agent 有职责边界;

  • MCP,让 Agent 可以连接真实系统。

但这些能力如果没有实际场景验证,仍然只是架构。

这一篇,我们做一个真正能落地的案例:

每天凌晨 2 点,Hermes 自动巡检服务器,发现异常后分析原因,生成报告,并通知负责人。

这就是一个典型的 AI 运维 Agent。


一、传统服务器巡检的问题

很多公司的服务器巡检流程其实很固定:

每天早上:

运维登录服务器。

查看:

然后整理成日报。

如果发现问题:

继续人工分析。

比如:

  • 为什么 CPU 突然升高?

  • 哪个服务异常?

  • 是代码问题还是流量问题?

  • 是否需要重启?

  • 是否需要扩容?

这些工作重复、规则明确,非常适合 AI Agent。

但注意:

不是让 AI 获得服务器权限后自己乱操作。

而是:

让 AI 做观察、分析和建议,人负责最终决策。


二、整体架构:Hermes 如何变成运维 Agent

整个流程可以设计成:

这里每一层职责不同:

1. Cron:什么时候执行

负责:

“什么时候执行”。

比如每天凌晨 2 点:

02:00 自动启动巡检任务

2. Ops Profile:谁来执行

负责:

“谁执行”。

它不是开发 Agent。

它只负责:

  • 系统检查;

  • 日志分析;

  • 运行状态判断。


3. Skill:按什么方法检查

负责:

“按照什么方法检查”。

例如:

1. 检查磁盘2. 检查 CPU3. 检查内存4. 检查服务5. 分析异常日志6. 输出报告


4. MCP:连接哪些系统

负责:

“连接哪些系统”。

例如:

LinuxDockerKubernetesPrometheusGrafana日志平台数据库

三、创建一个 Ops Agent

首先创建专门的运维 Profile:

hermes profile create ops \--description "负责服务器巡检、日志分析和运行状态检查,不执行高风险操作"

然后固定工作目录:

ops config set terminal.cwd /srv/hermes-ops

为什么不用默认 Agent?

因为运维和写代码不是一个角色。

开发 Agent 需要:

Git代码目录测试环境

运维 Agent 需要:

服务器状态日志监控运行环境

两者混在一起,很容易造成权限和记忆污染。


四、定义一个服务器巡检 Skill

不要每次让 Agent 临时发挥。

把流程固化。

例如:

daily-server-check目标:每天生成服务器健康报告。步骤:1.检查 CPU、内存、磁盘2.检查 Docker 服务状态3.检查最近 24 小时错误日志4.分析异常趋势5.生成巡检报告6.如果发现异常,创建事件任务

这样下一次执行:

不是重新思考。

而是执行固定流程。


五、凌晨自动执行

通过 Cron:

0 2 * * * hermes -p ops run daily-server-check

每天凌晨 2 点:

Hermes 自动启动。

执行:

人不用打开聊天窗口。

任务自己发生。

这也是 Hermes 和普通聊天机器人最大的区别:

聊天机器人等待问题,Agent 工作台主动执行任务。


六、发现异常以后怎么办?

假设巡检发现:

普通脚本只能报警。

AI Agent 可以继续分析:

它会读取:

  • 最近日志;

  • 服务配置;

  • 最近发布记录;

  • 历史类似事件。

然后生成:

异常:payment-service CPU异常升高可能原因:1.最近版本增加数据库查询次数2.连接池配置不足3.异常请求增加建议:1.检查最近commit2.观察数据库连接数3.暂不自动重启

注意:

这里 AI 没有直接重启服务。

因为:

分析和执行必须分离。


七、异常进入 Kanban

如果问题需要处理:

Hermes 创建任务:

任务:payment-service CPU异常分析负责人:ops状态:ready输入:巡检报告日志监控数据要求:确认原因并提出处理方案

之后:

Coder 可以接:

查看代码。

Researcher 可以接:

查询历史问题。

Ops 可以继续处理。

这时候:

一次告警变成了一条完整事件链。


八、一个实际企业落地方案

我建议不要第一天就让 AI 自动修服务器。

第一阶段:AI 观察员

能力:

✅ 自动巡检

✅ 自动日报

✅ 自动分析

✅ 自动告警


第二阶段:AI 分析员

增加:

✅ 日志关联分析

✅ 历史事件查询

✅ 根因分析


第三阶段:AI 运维助手

允许:

低风险自动操作:

例如:

  • 清理临时文件;

  • 重启测试环境服务;

  • 执行健康检查。

高风险操作:

必须人工审批:

例如:

  • 生产重启;

  • 数据库变更;

  • 网络调整。


九、为什么这个案例适合 Hermes?

因为它刚好体现了 Hermes 的完整能力:

这些能力单独看都不复杂。

真正有价值的是组合起来。


写在最后:AI 运维的重点不是自动敲命令

很多人理解 AI 运维:

就是让 AI 登录服务器,然后执行命令。

我认为这不是重点。

真正成熟的 AI 运维应该是:

它不是替代运维工程师。

而是把一个人的经验,变成一个可以每天运行的系统。

这也是 Hermes 这类 Agent 平台真正有价值的地方:

让 AI 从“回答问题”,变成“持续管理任务”。


Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐