0.2元造一个Agent还让它自己进化:Agent的“茅台定价“时代结束了
8月3日到8月7日,五天之内,两个开源Agent框架先后引爆开发者社区。一个是LlamaFactory作者郑耀威开源的PenguinHarness,号称0.2元就能从零构建一个能自我进化的Agent,成本只有OpenAI Codex的两百分之一。另一个是Prime Intellect开源的Prime Agent,在ARC-AGI-3上配合Opus 5跑出了95.5%,反超了人类专家基线,而且它能在运行中自己改写自己的提示词和技能。
单独看任何一个,都觉得"又一个新框架嘛"。但放在一起看,你会发现一个更底层的变化正在发生——Agent的构建成本,正在从"茅台定价"跌向"矿泉水定价"。
一、Agent成本为什么一直降不下来
过去两年,做Agent这件事的门槛其实一直挺高的,但高在的不是技术难度,而是成本。
做个对比你就明白了。2025年底,用OpenAI Codex搭一个能用的Agent,平均每次运行要消耗大约15万到20万Token。按当时的API定价,跑一轮就是几块钱。如果要做迭代优化——跑一遍、调一下、再跑一遍——几十次下来,几百上千块就没了。这还是你亲自动手调。如果想让Agent自己学会优化自己,那成本还要再翻几倍。
所以在过去很长一段时间里,Agent的定位是"大厂玩具"或者"高预算项目专属"。个人开发者想玩,要么用开源小模型凑合,效果差强人意;要么刷信用卡硬上API,月底看账单的时候心疼。
但2026年8月这一波,把整个成本结构给掀了。
二、PenguinHarness把成本打到0.2元,Prime Agent让"自进化"不再是噱头
先看PenguinHarness。
郑耀威团队开源的这套框架,核心思路其实挺反直觉的——它把Agent的"自我进化"变成了一个标准化流程。框架内置了一个叫GDPevo的评估基准,Agent每跑完一轮,系统自动评估它的表现,然后把评估结果写回文件系统。下一轮,Agent读取这些评估结果,自己决定怎么改自己的提示词、技能和记忆体。
我看了下他们公开的实测数据。一个初始评分53分的Agent,经过几轮自进化循环后,评分涨到了95分。整轮迭代的Token成本,折合人民币大约0.5元。项目主页上那个更夸张的"0.2元",是从零构建一个新Agent的起步价——不是开玩笑的。
更关键的是,PenguinHarness不是实验室产物。它已经在两个真实生产场景里跑通了:一家体检机构用它生成了报告核查Agent,过去30分钟才能审完的报告,现在几十秒;一家制造企业用它构建了产线巡检Agent集群,产线停机时间减少了65%。
再看Prime Agent。
Prime Intellect这家公司之前做的是去中心化算力,这次开源Agent框架,说实话有点跨界。但他们的思路很有意思——Prime Agent的核心是一个叫/refine的命令,Agent在运行过程中可以随时调用这个命令,对自己的提示词、技能、记忆做增删改查。换句话说,Agent不仅能完成你交给它的任务,还能在执行过程中不断优化自己完成任务的方式。
ARC-AGI-3的95.5%当然有争议——有人质疑这是对公开测试集的反复适配。但Prime Agent真正值得关注的地方不是那个分数,而是它展示的"Agent外壳可编程"这个方向。传统的Agent框架,提示词是写死的,工具列表是固定的,模型只能在这个框框里跑。Prime Agent反过来了:模型可以改框框本身。
两个框架放在一起,PenguinHarness解决的是"成本"问题,Prime Agent解决的是"能力边界"问题。一个把Agent从奢侈品变成日用品,一个把Agent从"执行者"变成"自我优化者"。
三、成本骤降之后,Agent生态会发生什么
我个人的判断是,这三个变化会最先发生。
第一,Agent将从"写代码"扩展到"非技术场景"。 PenguinHarness的两个落地案例已经说明了一切——体检报告核查、产线巡检,都不是传统意义上的"写代码"场景。当Agent的构建成本降到0.2元这个量级,企业不会只把它当编程助手用。客服、质检、数据录入、文档审核,这些场景的ROI一下子就算得过来了。
第二,"Agent运维"会成为一个真实存在的岗位。 成本降下来之后,Agent的数量会爆发式增长。一个企业可能同时跑几十上百个Agent,谁来管它们?谁来看Agent的决策日志是否偏离预期?谁在Agent自进化跑偏的时候叫停?Cloudflare的Agent Tracing和cMCP的安全审批层已经在做这件事了,但整个行业的人才供给几乎是空白。
第三,开源Agent框架的竞争会从"功能多少"转向"生态厚度"。 PenguinHarness内置了LlamaFactory、vLLM、Ollama的集成,Prime Agent以MIT协议开源且一行命令就能安装。但框架本身再强,没有周边的工具链、教程、社区插件,开发者还是不愿意用。微软8月6日在GitHub开源的"ai-agents-for-beginners"课程,18节课覆盖Agent基础到生产部署,上线就拿了7.1万星标——这说明Agent的学习成本,正在成为比运行成本更重要的门槛。
四、开发者现在该关注什么
说句实话,Agent框架的迭代速度已经快到让人有点跟不上了。但我觉得有三件事,值得现在就开始做。
一是亲手跑一遍。PenguinHarness和Prime Agent都是开源的,一行命令就能装。花一个下午跑通一个Demo,比看十篇分析文章都有用。你不需要成为专家,但你需要知道"这东西现在到底到什么程度了"。
二是关注"Agent可观测性"。Agent跑起来不难,但Agent跑偏了你怎么知道?Agent自进化出来的新技能,你敢不敢直接上生产?这些问题的答案,不在于Agent框架本身,而在于你对自己的Agent有没有足够的可见性。日志、追踪、审计——这些传统运维的常识,在Agent时代被重新需要了。
三是想清楚"人到底在哪个环节不可替代"。Agent能自己写代码、自己优化自己、自己跟其他Agent协作。那开发者做什么?我目前的理解是:定义目标、设定边界、审核结果。Agent再好用,它也不理解"这个功能到底值不值得做""这个方案的风险是什么"。这些判断,还是得人来。
五、结语
2024年做一个Agent,你得先选模型、搭框架、写提示词、调参数、跑评测、修Bug——一套下来,成本几千块,周期一两周。2026年8月,你花0.2元,让PenguinHarness帮你从零构建一个Agent,它还会自己迭代优化。
两年的时间,Agent从"要供着用的东西"变成了"随手拿来用的东西"。这个变化本身,可能比任何一个单独的框架发布都更有冲击力。
你试过用开源框架自己搭一个Agent了吗?如果试过,你觉得最大的坑在哪?
更多推荐



所有评论(0)