一、问题的提出

以大语言模型为底座的 AI Agent(智能体)正在成为信息化项目建设的新热点。政务问答、智能客服、辅助审批、数据分析等场景纷纷立项,随之而来的是造价评审环节一个绕不开的现实问题:一个智能体开发项目,规模究竟怎么算、费用究竟怎么核?传统的功能点方法在政务信息化项目造价领域已应用多年,形成了相对成熟的操作惯例;但智能体项目的需求描述方式、交付形态和技术构成,与以往的定制软件存在明显差异——系统的能力核心来自预训练大模型,开发方的实际工作集中于提示词设计、知识库建设、工具集成与业务编排。面对这类项目,评审人员往往陷入两难:完全沿用功能点方法,担心测不出”智能”的价值;完全弃用功能点方法,又失去客观、可审计的规模基准,容易滑向依赖专家经验的主观报价。

本文围绕四个问题展开:

  1. AI Agent 的开发究竟适不适用功能点方法;
  2. IFPUG、NESMA、COSMIC 三大国际标准分别如何适配智能体开发的规模测算;
  3. 三个标准在这一场景下的优劣分别是什么;
  4. 引用依据时,哪些才是真实可信的官方资料。

为便于理解,全文以一个贯穿实例进行演示:某市直单位拟建设”政策问答智能体”,办事群众以自然语言提问,系统检索政策法规知识库生成回答并附依据条文;后台支持知识库维护、权限配置、问答记录查询与服务统计报表;底层调用商用大模型 API。

二、功能点方法的基本原理与适用性边界

功能点方法属于功能规模测量(FSM,Functional Size Measurement)范畴。通俗地说,它从使用者的视角出发,数一数软件为用户”做哪些事”——保存哪些数据、响应哪些操作——而不关心软件”怎么做”,即与采用什么编程语言、什么技术架构无关。这一”用户视角、技术无关、度量做什么而非怎么做”的定位,由 ISO/IEC 14143 系列标准确立,是所有功能点方法共同的理论基础。

据此分析 AI Agent 开发的需求构成,可划出一条清晰的边界。边界之内是功能性需求:对话交互(用户提问、系统回答)、知识库管理(政策文件的录入、维护、检索)、工具调用与接口集成(身份认证、业务系统对接)、后台管理(权限配置、记录查询、统计报表)。这些需求完全符合功能点方法”从用户视角计数功能”的逻辑,天然可测。边界之外是模型智能本身:模型训练过程、推理响应性能、回答准确率与”聪明程度”。这些属于非功能性需求或质量属性,功能点方法本就不度量”做得多好”,只度量”做了多少”。

这一边界判断有明确的官方依据。COSMIC 方法对应的国际标准 ISO/IEC 19761 在其范围声明中明示,该标准未设计用于测量”自学习软件”等以复杂算法为核心的软件。国内评审实践也已给出衔接口径:《湖南省省直单位政府投资信息化项目预算编制与财政评审工作指南(试行)》明确,原则上采用 NESMA 功能点法编报,对无法采用功能点法评估的软件功能(如模型、算法、决策分析等),可采用工作量估算法。换言之,功能点方法管”功能”,工作量估算法管”模型与算法”,二者分工互补。对 AI Agent 项目而言,正确的做法不是追问”功能点方法行不行”,而是先划分哪些部分属于功能性需求、哪些属于模型智能或外购能力,再分而治之。

三、IFPUG 方法:规则体系最完备,AI 适配尚在探路

IFPUG(国际功能点用户组)方法是历史最久、规则体系最完备的功能点方法,现行计数手册为 CPM 4.3.1,对应国际标准 ISO/IEC 20926:2009,我国国家标准 GB/T 42449-2023 等同采用。该方法将软件功能划分为五类功能单元:数据功能两类——内部逻辑文件(ILF,系统内部维护的逻辑数据集合)和外部接口文件(EIF,系统引用但不维护的外部数据集合);事务功能三类——外部输入(EI,处理外部进入的数据或控制信息)、外部输出(EO,向外部输出经加工处理的数据)、外部查询(EQ,对数据的简单检索展示)。通俗地说,ILF 和 EIF 回答”系统管什么数据”,EI、EO、EQ 回答”系统做什么事”。

每个功能单元依据数据元素类型(DET)、记录元素类型(RET)和引用文件类型(FTR)判定低、中、高三档复杂度,查权重表取值:ILF 为 7/10/15,EIF 为 5/7/10,EI 为 3/4/6,EO 为 4/5/7,EQ 为 3/4/6。各单元未调整功能点(UFP)加总后,再经 14 项通用系统特性(GSC)调整:每项按 0 至 5 分评分,总影响度 TDI 取值 0 至 70,价值调整因子 VAF=0.65+0.01×TDI(取值 0.65 至 1.35),调整后功能点 AFP=UFP×VAF。在早期快速估算方面,IFPUG 于 2015 年采纳 NESMA 的估算法与指示法作为高层级功能点分析(High-level FPA)与指示功能点分析(Indicative FPA),另有简化功能点方法(SFP)可供选用。

将这套规则映射到 AI Agent 开发,属于基于现行规则的实务推导而非官方规则,但路径是自然的。以前述政策问答智能体为例:政策知识库、问答记录库由系统内部维护,各计一个 ILF,按平均复杂度计 2×10=20;统一身份认证接口属系统引用的外部数据,计一个 EIF,平均 7;提问提交、知识库维护、权限配置各计一个 EI,平均 3×4=12;统计报表涉及加工汇总,计一个 EO,平均 5;问答记录查询为简单检索,计一个 EQ,平均 4。合计 UFP=48;若 TDI=25,则 VAF=0.90,AFP=43.2。需要特别说明的是,底层商用大模型 API 属外购服务,其规模不计入本系统功能点,对应费用列入服务租赁或产品购置科目。这一区分——自建功能计数、外购能力另列科目——是 AI Agent 项目计价的基本边界。在实务工具层面,软件造价喵已接入主流大模型,可依据现行功能点标准自动识别功能点、生成测算报告,把计数人力从数天压缩到数分钟。

在官方动态层面,IFPUG 的 AI 适配尚处于探索阶段。2025 年 9 月 25 日,IFPUG 与韩国 KOSMA 在首尔合办 ISMA 2025 大会,时任 IFPUG 主席 Roopali Anand Thapar 发表主旨演讲”Estimating AI Agents Using Function Point Analysis (FPA)“,提出将 AI 功能映射到既有 FPA 组件、调整复杂度权重、纳入价值调整因子,并区分”从零构建”与”嵌入商用模型”两类开发模式的估算差异。必须定性准确:这是会议主旨演讲提出的个人实践框架,不是 IFPUG 发布的标准文件。同期两场网络研讨会分别以 AI 聊天机器人为案例讲解功能侧的事务功能与逻辑文件识别、用 SNAP 方法度量响应时间与安全性等非功能需求。此外,IFPUG 功能规模标准委员会已启动 CPM 现代化项目,但明确不改变 FPA 基本原则。

IFPUG 方法的优势在于规则细致、操作可审计,且国内落地链路最完整——有等同采用的国标,有配套的基准数据与评审惯例,测算结果容易获得评审各方认可。其劣势亦较明显:复杂度仅有低、中、高三档,对智能体自主规划、多轮推理等 AI 特有行为缺乏区分度;GSC 调整项诞生于传统信息系统语境,未涵盖模型依赖程度等新因素;AI 专项官方计数规则至今未发布,映射口径依赖测算人员的经验把握。

四、NESMA 方法:早期快速估算的利器

NESMA(荷兰软件度量协会)方法与 IFPUG 同源,其现行版本为 2.3 版,对应国际标准 ISO/IEC 24570:2018,我国国家标准 GB/T 42588-2023 修改采用。NESMA 的最大特色是提供精度分级的三种计数方法,供项目不同阶段选用。通俗地说,详细法用于”算清账”,估算法和指示法用于”打快板”。

详细功能点分析与 IFPUG 使用相同的五类单元和权重矩阵,适用于需求明确的阶段。估算功能点分析则简化复杂度判定:数据功能一律按低复杂度、事务功能一律按平均复杂度取值,即 UFP=7×ILF 数+5×EIF 数+4×EI 数+5×EO 数+4×EQ 数。指示功能点分析最为粗放,只数逻辑文件:功能规模=35×ILF 数+15×EIF 数;若数据模型已规范化至第三范式,另有 25×ILF+10×EIF 的变体。精度方面,估算法的实证误差区间约为-6%/+15%,指示法约为-15%/+50%。需要指出,NESMA 自 2.1 版起不再使用 14 项通用系统特性和 VAF 调整,这符合 ISO/IEC 14143 对功能规模测量”只测功能、不做价值调整”的定位,非功能因素改由生产率基准与估算模型处理。

AI Agent 项目恰恰是最需要”打快板”的场景。此类项目需求不确定性高,立项阶段往往只有场景描述和预期能力,无法支撑逐单元判定复杂度的详细计数;但立项批复、预算安排又必须有规模依据。NESMA 的估算法与指示法正好填补这一空档,这也是国内多地将 NESMA 作为评审主流的原因之一——前述湖南省的评审指南即明确”原则上采用 NESMA 功能点法编报”。

仍以前述政策问答智能体演示。沿用第三节识别出的功能单元(2 个 ILF、1 个 EIF、3 个 EI、1 个 EO、1 个 EQ),按估算法计算:UFP=7×2+5×1+4×3+5×1+4×1=40。按指示法计算:功能规模=35×2+15×1=85。两相对比,指示法较详细法(48)上浮明显,原因在于指示法只数逻辑文件,默认每个逻辑文件背后隐含全套事务功能。本例中智能体属于”数据少、交互多”的形态,指示法的粗糙性表现得尤为典型。因此,指示法适合立项早期的匡算与限额管理,进入初设或预算编审阶段后应升级为估算法或详细法复核,不宜将匡算数直接作为计价依据。

NESMA 方法的优势是快速、早期可用、国内主流评审体系接受度高,且与 GB/T 36964-2018 确立的”功能点规模—工作量—成本”三段式测算流程衔接顺畅。其劣势是以精度换速度,指示法误差上限可达+50%;与 IFPUG 一样,NESMA 目前没有发布任何针对大模型或智能体系统的专项计数规则,AI 特有因素既无计数单元承载,也因不使用 VAF 而无法通过调整因子体现,只能依赖生产率校准消化。

五、COSMIC 方法:数据移动模型天然贴近交互密集型系统

COSMIC 方法的现行测量手册为 5.0 版(与 4.0.2 版实质一致),对应国际标准 ISO/IEC 19761:2011(2025 年经复审确认现行有效),我国国家标准 GB/T 42452-2023 等同采用。与前两种方法不同,COSMIC 不设功能单元类型和复杂度权重,核心规则简洁:将软件分解为若干功能过程,每个功能过程由触发事件启动,过程内每一次数据移动计 1 个 CFP(COSMIC 功能点)。通俗地说,它不问”这个功能有多复杂”,只数”数据跨过边界流了几次”。

数据移动共分四类:Entry(数据从功能用户跨越边界进入功能过程)、Exit(数据从功能过程输出给功能用户)、Read(从持久存储读入)、Write(写入持久存储)。每个功能过程最小规模为 2 CFP。COSMIC 不设 VAF 式调整因子:非功能需求能转化为功能需求的直接度量,其余通过生产率与估算模型处理。针对早期阶段,官方提供了”平均功能过程近似法”等快速估算指引,但强调须经本地数据校准。

这一模型与 AI Agent 的交互密集特征高度契合。智能体的核心使用形态就是一轮轮”提问—处理—回答”,每次交互都可自然拆解为数据移动流。仍以前述政策问答智能体演示:“提问—回答”功能过程包含提问进入(Entry)、读取政策知识库(Read)、写入问答记录(Write)、回答输出(Exit),计 4 CFP;“知识库维护”为 Entry+Write,计 2 CFP;“权限配置”为 Entry+Write,计 2 CFP;“问答记录查询”为 Entry+Read+Exit,计 3 CFP;“统计报表”需分别读取问答记录与知识库数据再输出,计 2×Read+Exit=3 CFP。合计 14 CFP。可以看到,每一次用户交互的数据流动都被逐一计数,粒度比 IFPUG 的三档复杂度更细,后续需求变更也能以 1 CFP 为单位精确度量增量。边界处理上,商用大模型 API 作为本系统之外的另一个软件(即功能用户)对待,其自身规模不计入本系统,与”外购服务不计功能点”的口径一致。

官方动态方面,COSMIC 社区已设立 AI Software Sizing Taskforce(AI 软件规模测算工作组),但官网明确其尚处路线图阶段,首个公开版本尚未发布。已发布的 AI 邻近官方材料是 2019 年案例研究《Sizing software in a Machine Learning context: A COSMIC Case study》,该研究用 COSMIC 度量神经网络图像分类软件,并演示了如何将机器学习特有功能与通用软件功能分离处理——这与本文强调的边界划分思路一脉相承。

COSMIC 方法的优势在于比率量表开放无上限、粒度细、变更可度量,对交互密集、事件驱动的智能体系统在原理上贴合度最高。其劣势是:国内应用生态相对薄弱,评审人员与基准数据的积累不及 IFPUG/NESMA;不设调整因子,行业差异全部依赖生产率校准,对基准数据质量要求高;官方 AI 专项指引尚未发布,且 ISO/IEC 19761 明示该标准未设计用于自学习软件,意味着模型本身的规模测量在标准层面仍是空白。

六、三大标准对比与务实选择

综合前文分析,三大标准在 AI Agent 规模测算中的定位可归纳如下表。

务实选择应把握三条原则。

第一是计价边界原则

无论采用哪种方法,外购大模型底座及其 API 调用均不计功能点,对应费用列入产品购置或服务租赁科目,仅定制开发部分(知识库建设、接口集成、业务编排、管理后台等)进入功能点计数。这与国内”软硬件分开列项、定制开发单独测算”的评审惯例直接衔接——温州市地方标准《政务信息化项目软件开发费用测算规范》(DB3303/T059-2023)即明确”软硬件购置费、第三方测评费等费用单独列支,不包括在软件开发费用内”。

第二是因子校准原则

《中国软件行业基准数据》CSBMK-202510(2025 年 10 月发布)已将”大模型”纳入”智能信息”应用类型调整因子,取值为 1.5,同时给出 2025 版全行业功能点生产率基准 P50 为 6.72 人时/功能点。中国软件行业基准数据报告CSBSG(SSM-BK-202509),AI+开发生产率为P50=5.71(人时/功能点),中位数低于全行业(6.96),体现 AI 提效;AI+开发工作量分布为需求 15.82%、设计 16.32%、构建 25.06%、测试 31.22%、实施 11.58%,构建占比较全行业(38.16%)大幅下降;应用类型调整因子中,智能应用(含智能体开发)取值 1.5,智能信息(含人工智能/NLP/专家系统)取值 1.7。这意味着行业基准体系选择的是”计数规则不变、以调整因子和生产率消化 AI 特征”的路线,测算时按 GB/T 36964-2018 的三段式流程即可完整落地:功能点计数→乘生产率得工作量→套调整因子与人月费率得成本。

第三是工具提效原则

AI Agent 项目的功能识别与文档比对工作量较大,可借助软件造价喵自动识别功能点、生成测算报告,测算人员专注边界判定和各类调整因子复核。

七、结语

回到本文标题之问:AI Agent 的开发适用于功能点方法吗?答案是肯定的,但有边界。

在功能性需求范围内,功能点方法完全适用——对话交互、知识库管理、工具集成、后台管理等功能均可按现行规则计数,IFPUG、NESMA、COSMIC 三大标准各有适配路径与适用阶段;

模型智能本身则不属于功能规模测量对象,应通过工作量估算、生产率校准或另列科目处理。

从落地条件看,国内已形成”国家标准(GB/T 36964 及功能规模测量国标家族)+行业基准数据(CSBMK和CSBSG)+应用类型调整因子“的完整链路,AI Agent 项目造价测算并非无据可依。实践上应坚持”功能点计数+边界划分+因子校准”的组合口径,既用好成熟方法,又为后续官方规则的出台预留衔接空间。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐