NeFut Logo NeFut
EN 管理员登录

[AI学术] 感知、布局与验证:用于可靠金融文档直通处理的校准置信度

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#algorithm #AI #Machine Learning

直通处理(STP)要求在无需人工复核的情况下,对从金融文档中提取的键值对提供校准的概率,并对自动批准层的残余错误给出有界保证。现代视觉语言模型(VLM)能够直接提取键值,但其口头化的置信度信号不可靠,且与字段正确性关联薄弱。本文提出了一种分解置信度层,沿感知、布局和验证三个可解释通道进行评估,并结合最终的共形风险控制,使得得分可用于可靠的金融文档 STP。该方法在三个公开数据集上进行验证,覆盖真实发票、合成发票和广告投放表单,使用两类 VLM(Qwen3.6-27B 与 Gemini-3.1-Flash-Lite)。分解得分始终提升正确与错误提取的区分度,将 AUROC 从 VLM 口头信号的 0.54‑0.74 提升至 0.90‑0.99,三通道均有贡献。对工业部署而言,这意味着在目标错误率下,原生 VLM 置信度只能清除 0.1%‑7.0% 的字段,而本文方法可实现可用的 STP。

点评:该方法通过多模态信号的解耦与风险控制,实现了金融文档的高置信度自动化处理,具备工业落地潜力。

原文链接: https://arxiv.org/abs/2609.20110

[h] 返回首页