摘要:大型语言模型(LLMs)在金融领域展现出应用潜力,然而,由于现有基准测试存在不足,其在这一高风险领域的适用性在很大程度上尚未得到验证。现有基准测试仅依赖评分层面的评估,用一个单一分数总结模型性能,却掩盖了对模型真正掌握的知识及其具体局限性的细致理解。此外,这些基准测试所依赖的数据集仅涵盖金融概念的狭隘子集,而忽略了现实应用中其他必备要素。为填补这些空白,我们推出了首个专为金融大语言模型量身定制的认知诊断评估框架——FinCDM。该框架能够在知识技能层面评估大语言模型,通过分析模型在标记了技能类型的任务中的回答模式,识别其具备或欠缺的金融技能与知识,而非仅依赖一个汇总数字。我们构建了首个基于认知科学的金融评估数据集CPA-QKA,该数据集源自注册会计师(CPA)考试,全面覆盖现实世界中的会计与金融技能。该数据集由领域专家严格标注,专家在编写、验证问题以及添加标注时达成高度一致性,并附有细粒度的知识标签。我们对30个专有、开源及特定领域的大语言模型进行了广泛实验,结果表明,FinCDM能够揭示隐藏的知识缺口,识别传统基准测试忽视的税务与监管推理等测试不足的领域,并发现模型间的行为聚类。FinCDM开创了金融大语言模型评估的新范式,通过实现可解释、技能感知的诊断,为更可靠、更有针对性的模型开发提供支持。所有数据集和评估脚本将公开发布,以支持进一步研究。Huggingface链接:Paper page,论文链接:2508.13491

研究背景和目的

研究背景

随着大型语言模型(LLMs)在自然语言处理(NLP)领域的广泛应用,其在金融、医疗、法律等多个专业领域的应用潜力逐渐显现。然而,这些高风险领域对模型的准确性和可靠性要求极高,传统的基准测试方法往往依赖于单一的总分评估,无法全面反映模型在具体任务中的真实能力和局限性。例如,在金融领域,现有的基准测试通常只能提供模型整体表现的粗略评估,而无法深入分析模型在不同金融概念和技能上的具体掌握情况。此外,许多基准测试的数据集覆盖范围有限,难以全面评估模型在处理复杂金融任务时的表现。

现有的LLMs评估框架主要依赖于综合得分,这种评估方式存在两个主要问题:一是“分数扁平化”(score flattening),即数据集被简化为一个单一分数,无法反映模型实际掌握的知识;二是“覆盖不平衡”(coverage imbalance),即示例过度依赖某些特定类型的金融知识或技能,难以全面评估模型在处理各种实际需求时的表现。例如,在会计问题中,大多数项目集中在总收入和净收入等少数概念上,而忽略了股权变动或税务相关组件等其他重要领域。

研究目的

本研究旨在解决现有LLMs评估框架在金融领域中的不足,提出一种基于认知诊断模型(CDM)的评估框架FinCDM,用于评估金融LLMs在知识-技能层面的表现。具体目标包括:

  1. 开发一个全面的金融知识框架:基于注册会计师(CPA)考试内容,构建一个覆盖70个核心金融概念的框架,确保对金融知识的全面覆盖。
  2. 构建高质量的金融评估数据集:通过领域专家严格标注,创建一个新的数据集CPA-QKA,支持知识-技能层面的评估。
  3. 提出FinCDM评估框架:利用非负矩阵协同分解方法,评估LLMs在不同金融技能和知识上的掌握情况,揭示模型的优势和不足。
  4. 通过实验验证框架的有效性:在30个专有、开源和特定领域的LLMs上进行广泛实验,展示FinCDM在揭示模型知识差距、识别未测试领域以及发现模型行为集群方面的能力。

研究方法

1. 金融知识框架构建

研究参考了CPA考试的内容和技能规范大纲,构建了一个覆盖70个核心金融概念的框架。这些概念涵盖了会计、审计、财务成本管理、公司战略与风险管理、经济法和税法等多个核心金融领域,确保了对金融知识的全面覆盖。

2. 数据集构建

研究构建了一个新的数据集CPA-QKA,该数据集由领域专家严格标注,确保每个问题都准确对应一个或多个金融概念。数据集构建过程包括两个阶段:问题创作和知识标签标注。在问题创作阶段,三位领域专家分别为每个金融概念创作多个问题,确保问题的多样性和认知视角的多样性。在知识标签标注阶段,另外两位专家对每个问题进行独立标注,确保问题准确对应预定义的金融概念。

3. 评估框架设计

FinCDM框架基于认知诊断模型(CDM),通过非负矩阵协同分解方法,评估LLMs在不同金融技能和知识上的掌握情况。具体步骤包括:

  • 构建响应矩阵X:收集LLMs对CPA-QKA数据集中问题的响应,形成响应矩阵X。
  • 构建Q矩阵:通过专家标注,构建问题与金融概念之间的关联矩阵Q。
  • 非负矩阵协同分解:利用非负矩阵协同分解方法,将X和Q分解为低维潜在表示,估计LLMs在不同潜在技能上的熟练程度。
  • 模型能力评估:结合学习到的潜在矩阵U和V,估计每个LLM在金融概念上的熟练程度,提供详细的、可解释的诊断结果。

4. 实验设计

研究在30个专有、开源和特定领域的LLMs上进行了广泛实验,包括闭源通用模型(如GPT-4、Claude 3.5 Sonnet等)、开源通用模型(如Baichuan2-13B-Chat、ChatGLM3-6B等)以及金融领域模型(如Finma-7b-Full、CFGPT2-7B等)。实验中,每个LLM被提示回答CPA-QKA数据集中的问题,生成多个响应以计算最终性能分数。

研究结果

1. FinCDM框架的有效性

FinCDM框架通过非负矩阵协同分解方法,成功揭示了不同LLMs在金融知识和技能上的掌握情况。实验结果表明,FinCDM能够提供比传统综合得分更全面的评估,揭示模型在不同金融概念上的优势和不足。例如,Claude3.5 Sonnet在CPA-QKA数据集上表现出较高的平均准确率,但FinCDM分析显示其性能集中在少数概念上,而在其他概念上的表现较弱。

2. 不同模型在金融知识上的表现

实验结果显示,不同模型在金融知识上的表现存在显著差异。例如,Gemini-2.5-Pro-Exp和Doubao-1.5-Pro-256k在整体通过率上表现相似,但在具体金融概念上的掌握情况却有所不同。Gemini在一般会计类别(如或有事项和租赁)上表现出色,而Doubao在财务管理领域(如长期投资决策、长期融资决策和营运资金管理)上表现更强。

3. 语言资源对模型性能的影响

实验还揭示了语言资源对模型性能的重要影响。缺乏足够中文语言资源的模型在金融任务上的表现普遍较差。例如,Falcon-7B由于缺乏足够的中文预训练数据,其通过率仅为0.15,且在金融概念上的掌握情况极差。这一结果强调了足够的语言基础对于有效领域适应的必要性。

4. 数据集结构对模型理解的影响

通过对比不同数据集上的模型表现,研究发现数据集结构对模型理解金融知识的能力有重要影响。例如,在FIN EVAL-KQA数据集上,模型的表现高度依赖于概念的频率和表示,而CPA-KQA数据集则提供了更平衡的概念表示,能够更全面地评估模型的理解能力。

研究局限

尽管FinCDM框架在评估金融LLMs方面展现出了显著优势,但本研究仍存在一些局限性:

1. 数据集覆盖的有限性

尽管CPA-QKA数据集覆盖了70个核心金融概念,但仍可能无法涵盖所有实际金融任务中可能遇到的概念和技能。未来研究需要进一步扩展数据集,以更全面地评估模型在处理复杂金融任务时的表现。

2. 标注一致性的挑战

尽管领域专家在标注过程中遵循了严格的质量控制流程,但不同专家之间的标注一致性仍可能存在差异。未来研究需要探索更有效的标注方法和质量控制流程,以提高标注的一致性和可靠性。

3. 模型规模的局限性

本研究的实验主要在中等规模的模型上进行,未来研究需要在大规模模型上验证FinCDM框架的有效性和可扩展性。

未来研究方向

针对上述研究局限,未来的研究可以从以下几个方面展开:

1. 扩展数据集覆盖范围

进一步扩展CPA-QKA数据集,增加更多金融概念和技能,以更全面地评估模型在处理复杂金融任务时的表现。同时,探索多语言和多模态金融内容的融入,提高框架的适用性和灵活性。

2. 提高标注一致性和效率

探索更有效的标注方法和质量控制流程,如利用主动学习策略选择最具信息量的样本进行标注,提高标注的一致性和效率。同时,开发自动化标注工具,减少人工标注的工作量和成本。

3. 在大规模模型上验证框架有效性

在大规模模型上验证FinCDM框架的有效性和可扩展性,探索其在处理更复杂金融任务时的表现。同时,研究不同规模模型在金融知识掌握情况上的差异,为模型优化和部署提供指导。

4. 结合其他评估方法

将FinCDM框架与其他评估方法(如人类评估、对抗性测试等)相结合,提供更全面、更准确的模型评估结果。同时,探索将诊断反馈用于指导模型微调,提高模型的性能和可靠性。

5. 跨领域和跨任务泛化

研究FinCDM框架在跨领域和跨任务场景中的泛化能力,探索其在医疗、法律等其他高风险领域的应用潜力。通过迁移学习和元学习技术,使模型能够快速适应新领域和新任务,减少对大量标注数据的依赖。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐