NeFut Logo NeFut
EN 管理员登录

[AI学术] ESF-Bench: 颠覆性企业应用的槽填充基准测试

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

大型语言模型(LLMs)的快速崛起推动了企业的变革性采用。然而,在真实环境中部署这些模型面临着复杂的系统约束和意外的用户行为等独特挑战。在这些应用中,槽填充是将非结构化输入转换为结构化可操作数据的关键。

在本研究中,我们介绍了ESF-Bench,这是一个具有挑战性的企业槽填充基准,包含810个多轮样本和6530个槽,覆盖8个独特领域。该基准基于57种在真实企业部署中观察到的最具挑战性的槽填充场景的分类法进行策划,揭示了当前最先进的LLMs的显著局限性。以GPT-OSS-120b为例,其成功提取槽的样本仅为20.7%。

为支持该领域的持续研究,我们在GitHub上公开发布了基准数据集、分类法及相关评估代码。

博主点评: ESF-Bench的发布为企业应用中的槽填充任务提供了重要的基准,揭示了当前LLMs在实际应用中的局限性。这将推动更高效的模型开发和实际应用的改进。研究人员可以利用这一数据集深入研究并优化槽填充技术,促进企业智能化进程。

原文链接: https://arxiv.org/abs/2607.23326

[h] 返回首页