别再手写 Prompt 了:聊聊怎么让 AI Agent 自己长出新能力(含完整实操)
前段时间搞 Agent 开发的一个感受:限性能的不是模型,是你不会给它"装插件"。这篇把我最近摸出来的 Skill 体系经验整理一下,从原理到实操,都是踩坑换来的。
一、先说痛点:为什么你的 Agent 总是"一本正经地胡说八道"
用过 Cursor、CatPaw 这类 AI 编程助手的同学应该有体会:让它写个排序算法、改个 Bug 很稳,但任务一旦垂直起来,比如"预测这场比赛的胜率"“按抖音爆款套路写文案”“分析一份世界杯赔率表”——它就开始自由发挥了。
原因不难理解:LLM 是通用模型,它对垂直领域只有"训练数据里残留的印象",没有方法和数据。你让它预测球赛,它其实是在模仿球评文的语气,而不是在算概率。
我自己踩过的坑是硬写超长 Prompt。给一个世界杯预测任务写过 800 行的系统提示词,塞特征、塞权重、塞输出格式,结果每次改需求都要全文重构,而且模型经常忽略中间某段。Prompt 越长,模型越记不住,这是硬伤。
二、换一种思路:把能力做成可插拔的"技能包"
后来接触到了 Skill(技能)这个机制,思路一下子打开了。它本质上是把"领域知识 + 方法论 + 工具脚本"打包成一个标准目录,Agent 按需加载。你可以把它理解成 Agent 世界的插件系统。
一个典型的 Skill 目录长这样:
my-skill/
├── SKILL.md # 技能说明书:触发条件、使用流程
├── scripts/ # 可执行脚本(Python/Node 均可)
│ └── predict.py
└── assets/ # 数据、模板等资源
其中 SKILL.md 是核心,用 YAML frontmatter 声明元信息:
---
name: match-predictor
description: 基于 Elo 和赔率的足球比赛胜率预测,当用户要求预测比赛结果时使用
---
关键在 description 字段——Agent 是靠语义匹配这段描述来决定何时加载这个技能的。所以 description 写得好不好,直接决定技能触发得准不准。这有点像搜索引擎的 SEO,写得含糊就永远不会被唤起。
三、实操:从零给 Agent 装一个预测技能
光说不练假把式,拿我实际跑通的例子走一遍。
第一步:确定技能边界。 我要的是"给定两支球队,输出胜/平/负概率和置信度"。注意边界要收窄,一个技能只干一件事,别做大而全。
第二步:准备方法论和数据。 这步决定技能的下限。我用的是 Elo 等级分差值 + 主场优势修正 + 近期胜率加权,纯统计方法,不依赖模型幻觉。核心逻辑几十行 Python:
def expected_score(elo_a, elo_b, home_adv=65):
"""Elo 期望胜率"""
return 1 / (1 + 10 ** ((elo_b - elo_a + home_adv) / 400))
第三步:写 SKILL.md。 别写成产品文档,要写成"给另一个 AI 的操作手册":什么情况触发、按什么步骤执行、脚本怎么调、输出格式是什么。我踩过的坑是早期写得太空,Agent 加载了技能却不知道什么时候该用。
第四步:验证触发。 用十几种不同的问法去测试描述字段的命中率,比如"预测比赛"“这场谁赢”"胜率多少"都要能触发。命中率低的,回去改 description。
整个流程下来,Agent 处理预测任务的质量从"瞎猜"提升到了"有方法、有数据、有置信度"的输出,而且方法迭代只改技能包,不动 Agent 本身。
四、进阶技巧:几个我交过学费的经验
1. 技能之间可以叠加。 比如基础预测技能之上,再叠一个"伤停因子修正"技能,Agent 会按优先级组合调用。设计时留好接口,别让技能互相打架。
2. 数据脚本和 Prompt 要分离。 计算交给脚本,脚本输出 JSON,再让模型基于结果写解读。千万别让模型心算概率——它算不对,还一副很有把握的样子。
3. 输出要带不确定性。 强制技能输出"置信度"字段,模型转述时会自然带上"这场爆冷风险较高"这类表述,比斩钉截铁的假专业可信得多。
4. 去哪找现成的技能? 自己写技能有学习成本,其实很多常见场景(预测、文案、视频生成、数据分析)社区都有人封装好了。我是通过一个叫 Deep Skill Finder 的技能检索器来按需发现和安装的,遇到新任务先搜一下有没有现成的,比自己造轮子快很多。技能库在 觅游技能便利店,有评分和认证机制,可以按需取用。
五、写在最后
Skill 体系给我的最大启发是:和 AI 协作的正确姿势,不是跟它辩论"你错了",而是给它递上正确的方法论。 模型的通用能力是底座,垂直能力靠插件化积累,这套思路在 Agent 工具越来越普及的当下,值得每个开发者花一个下午上手试试。
下一篇打算写"怎么给你的 Skill 做评估和调优"(怎么量化一个技能到底有没有用),感兴趣的关注一下,更新了不迷路。
实测环境:Windows 11 + CatPaw Agent。文中代码可直接运行,转载请注明出处。
更多推荐


所有评论(0)