NeFut Logo NeFut
EN 管理员登录

[AI学术] FORCE-Bench:企业金融领域的智能代理基准与评估工具

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

摘要

近期大规模语言模型的进步促进了智能代理系统在金融运营中的部署。现有基准主要关注一般能力、指令遵循或安全性,鲜有针对智能系统在金融自动化工作流中的实际应用进行评估。

金融专业人士需要代理不仅提供事实准确、扎实的信息,还需确保这些信息可验证,并始终遵循金融运营领域的规则与约束。为此,我们推出了FORCE-Bench,包含251个专家注释的查询,并使用基于评分标准的框架进行评估,涵盖金融领域的八个维度:准确性、引用、清晰度、深度、扎实性、时效性、相关性和结构。

FORCE-Bench对智能系统在三种任务类型下进行评估:财务义务研究(查询ERP系统以获取应收应付数据)、财务实体绩效研究(回答来自公共文件和市场数据的时限问题)以及商业简报生成(综合多源公司情报报告)。为反映真实的部署环境,我们在常用工具访问和延迟限制条件下评估了专门构建的代理及通用智能系统。

结果显示,通用智能系统在运营约束下未能始终满足金融领域的质量要求,而为Microsoft 365 Copilot构建的专用金融代理在各个维度上表现更为可靠。我们将数据集、评分标准、工具和分析代码作为开源发布,以支持可重复的比较和适应其他企业金融环境。

博主点评: FORCE-Bench的推出为金融领域的智能代理系统提供了重要的评价标准,强调了在实际应用中对信息准确性和可验证性的需求。此举不仅推动了金融技术的发展,也为研究者提供了宝贵的工具与数据支持,助力于更加可靠的智能系统构建。

原文链接: https://arxiv.org/abs/2607.19409

[h] 返回首页