让 Hermes 每天凌晨自动巡检服务器:AI 运维 Agent 实战
前面几篇,我们一直在解决一个问题:
如何让 AI 从聊天助手,变成一个真正参与工作的系统。
我们给 Hermes 加了:
-
Gateway,让任务可以主动进入;
-
Cron,让任务可以定时触发;
-
Kanban,让任务有状态、有记录;
-
Profile,让不同 Agent 有职责边界;
-
MCP,让 Agent 可以连接真实系统。
但这些能力如果没有实际场景验证,仍然只是架构。
这一篇,我们做一个真正能落地的案例:
每天凌晨 2 点,Hermes 自动巡检服务器,发现异常后分析原因,生成报告,并通知负责人。
这就是一个典型的 AI 运维 Agent。
一、传统服务器巡检的问题
很多公司的服务器巡检流程其实很固定:
每天早上:
运维登录服务器。
查看:

然后整理成日报。
如果发现问题:
继续人工分析。
比如:
-
为什么 CPU 突然升高?
-
哪个服务异常?
-
是代码问题还是流量问题?
-
是否需要重启?
-
是否需要扩容?
这些工作重复、规则明确,非常适合 AI Agent。
但注意:
不是让 AI 获得服务器权限后自己乱操作。
而是:
让 AI 做观察、分析和建议,人负责最终决策。
二、整体架构:Hermes 如何变成运维 Agent
整个流程可以设计成:

这里每一层职责不同:
1. Cron:什么时候执行

负责:
“什么时候执行”。
比如每天凌晨 2 点:
02:00 自动启动巡检任务
2. Ops Profile:谁来执行
负责:
“谁执行”。
它不是开发 Agent。
它只负责:
-
系统检查;
-
日志分析;
-
运行状态判断。
3. Skill:按什么方法检查
负责:
“按照什么方法检查”。
例如:
1. 检查磁盘2. 检查 CPU3. 检查内存4. 检查服务5. 分析异常日志6. 输出报告
4. MCP:连接哪些系统

负责:
“连接哪些系统”。
例如:
LinuxDockerKubernetesPrometheusGrafana日志平台数据库
三、创建一个 Ops Agent
首先创建专门的运维 Profile:
hermes profile create ops \--description "负责服务器巡检、日志分析和运行状态检查,不执行高风险操作"
然后固定工作目录:
ops config set terminal.cwd /srv/hermes-ops
为什么不用默认 Agent?
因为运维和写代码不是一个角色。
开发 Agent 需要:
Git代码目录测试环境
运维 Agent 需要:
服务器状态日志监控运行环境
两者混在一起,很容易造成权限和记忆污染。
四、定义一个服务器巡检 Skill
不要每次让 Agent 临时发挥。
把流程固化。
例如:
daily-server-check目标:每天生成服务器健康报告。步骤:1.检查 CPU、内存、磁盘2.检查 Docker 服务状态3.检查最近 24 小时错误日志4.分析异常趋势5.生成巡检报告6.如果发现异常,创建事件任务
这样下一次执行:
不是重新思考。
而是执行固定流程。
五、凌晨自动执行
通过 Cron:
0 2 * * * hermes -p ops run daily-server-check
每天凌晨 2 点:
Hermes 自动启动。
执行:

人不用打开聊天窗口。
任务自己发生。
这也是 Hermes 和普通聊天机器人最大的区别:
聊天机器人等待问题,Agent 工作台主动执行任务。
六、发现异常以后怎么办?
假设巡检发现:

普通脚本只能报警。
AI Agent 可以继续分析:
它会读取:
-
最近日志;
-
服务配置;
-
最近发布记录;
-
历史类似事件。
然后生成:
异常:payment-service CPU异常升高可能原因:1.最近版本增加数据库查询次数2.连接池配置不足3.异常请求增加建议:1.检查最近commit2.观察数据库连接数3.暂不自动重启
注意:
这里 AI 没有直接重启服务。
因为:
分析和执行必须分离。
七、异常进入 Kanban
如果问题需要处理:
Hermes 创建任务:
任务:payment-service CPU异常分析负责人:ops状态:ready输入:巡检报告日志监控数据要求:确认原因并提出处理方案
之后:
Coder 可以接:
查看代码。
Researcher 可以接:
查询历史问题。
Ops 可以继续处理。
这时候:
一次告警变成了一条完整事件链。

八、一个实际企业落地方案
我建议不要第一天就让 AI 自动修服务器。
第一阶段:AI 观察员
能力:
✅ 自动巡检
✅ 自动日报
✅ 自动分析
✅ 自动告警
第二阶段:AI 分析员
增加:
✅ 日志关联分析
✅ 历史事件查询
✅ 根因分析
第三阶段:AI 运维助手
允许:
低风险自动操作:
例如:
-
清理临时文件;
-
重启测试环境服务;
-
执行健康检查。

高风险操作:
必须人工审批:
例如:
-
生产重启;
-
数据库变更;
-
网络调整。
九、为什么这个案例适合 Hermes?
因为它刚好体现了 Hermes 的完整能力:

这些能力单独看都不复杂。
真正有价值的是组合起来。
写在最后:AI 运维的重点不是自动敲命令
很多人理解 AI 运维:
就是让 AI 登录服务器,然后执行命令。
我认为这不是重点。
真正成熟的 AI 运维应该是:

它不是替代运维工程师。
而是把一个人的经验,变成一个可以每天运行的系统。
这也是 Hermes 这类 Agent 平台真正有价值的地方:
让 AI 从“回答问题”,变成“持续管理任务”。
更多推荐


所有评论(0)