NeFut Logo NeFut
EN 管理员登录

[AI学术] Telco-GAIA:电信领域双语基准测试的创新突破

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

我们介绍了Telco-GAIA,一个双语、多模态的基准测试,用于评估在真实电信运营商数据上的工具使用代理。Telco-GAIA包含100个经过人工验证的问答任务,分别用英语和阿拉伯语呈现,每个任务要求在三个异构来源上进行多跳推理(平均4.2跳):静态网站快照(HTML、图像和链接的PDF)、一个合成的关系型SQL数据库,以及外部网页档案,涵盖文本、图像和表格等多种形式。

基准测试以沙箱Docker环境提供,并通过标准化的精确字符串匹配进行评分,使评估过程客观、确定且可重复,无需使用大型语言模型(LLM)作为评判者。

在对十二个商业和开源LLM进行评估时,我们发现Telco-GAIA具有挑战性:即使是最强的模型也仅解决了71%的任务;在适度的成本预算下,这一比例降至约40%,而且视觉基础的类别表现最弱,平均后端得分低于30%,在文档和图像理解方面还有显著提升空间。

Telco-GAIA为企业代理提供了一个严谨、可重复的测试平台,并为构建封闭域基准测试提供了模板。

博主点评: Telco-GAIA的提出为电信领域的智能代理评估提供了新思路,尤其是在多模态推理方面的挑战,展示了现有模型在复杂任务上的局限性。此基准不仅为研究者提供了丰富的数据源,也为行业应用的改进指明了方向。

原文链接: https://arxiv.org/abs/2607.20510

[h] 返回首页