企业在金融规划与分析(FP&A)等受监管的工作流中采用大语言模型(LLM)时,面临的核心瓶颈不是模型的流畅度,而是答案的可追溯性和事后审计能力。只有当生成的答案能够映射到权威来源并提供完整的溯源链时,才被视为可用。
本文提出了知识驱动分析框架(KDAF),主张在企业金融场景下,检索增强生成(RAG)应当在审计性与准确性两条维度上进行评估。KDAF 通过六个迭代阶段构建本体驱动的知识系统,并采用上下文感知相关传播(CARP)进行证据检索,使每条检索到的事实同时携带关系类型、置信度和来源血统信息。
实验使用 FinanceBench(145 条金融问答)进行对比,基准包括零上下文直接推理、BM25、概念加权词汇检索以及无依据的图遍历。结果显示:
- 检索是必要的:零上下文推理的正确率仅为 4.1%,而检索增强条件在 10%‑12% 之间。
- 在答案正确率上,KDAF 与 BM25 的差异不显著(差值 -0.007,95% CI [-0.021, 0.000]),说明仅凭准确率不足以证明结构化检索的价值。
- 在审计性指标上,KDAF 明显领先,引用可追溯性 F1 达到 0.515,分别比无依据遍历提升 0.027(CI [0.006, 0.050])和比 BM25 提升 0.052(CI [0.024, 0.083]),且区间不包含零。
- 基于图结构的检索完全避免了与问题主体实体无关的证据(0/426 条),而词汇基线的外部证据比例分别为 16.8% 和 20.2%。每条被选中的证据都能解析出完整的溯源链。
综上,审计性而非单纯的准确性是本体驱动检索值得投入的关键维度。KDAF 通过结构化的本体和 CARP,实现了可审计的答案生成,为企业金融中的 LLM 应用提供了可靠的技术路径。
博主点评:本文在强调金融合规需求的同时,提供了系统化的本体构建与证据传播方法。实验设计严谨,尤其是对审计性指标的量化评估,为后续研究提供了可复现的基准。未来可进一步探索跨域本体迁移和实时溯源可视化,以提升实际部署的灵活性。