NeFut Logo NeFut
EN 管理员登录

[AI学术] FinInteract:模糊金融问答的澄清与意图整合基准

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

大型语言模型(LLM)代理越来越多地通过检索监管文件来回答金融问题。这类问题常常隐含歧义,例如 Meta Platforms 的“营业收入”在合并报表中为 467.5 亿美元,而在 Family of Apps 部门为 628.7 亿美元,两种数值均可在文件中查证。一个合格的代理应当识别歧义并主动提问,而不是盲目给出一种可能并非提问者意图的答案。现有金融基准只能为每个问题提供唯一金标准答案,无法区分“主动澄清”与“盲目猜测”,我们称之为单金标准幻觉。FinInteract 是一个中英双语基准,收录 173 条实例,每条问题配有默认解释和目标解释,覆盖五类歧义 taxonomy。基准评估代理是否能够先引导出正确的澄清,再将其整合进答案。实验显示,若将相同输出对照默认解释重新评分,GPT‑4o 的准确率会被夸大 3.1 倍,验证了单金标准幻觉的存在。进一步分析发现:在提供明确解释后,模型的回答准确率超过 90%;但若要求模型自行引导澄清,最高准确率仅为 28.9%。在实体范围和指标定义这两类歧义上,模型表现相对均衡;而在探索性歧义上表现较差。将歧义类别作为条件信息,无论在推理阶段还是训练阶段,都能显著提升模型的歧义解析能力。

点评

原文链接: https://arxiv.org/abs/2609.24002

[h] 返回首页