NeFut Logo NeFut
EN 管理员登录

[AI学术] 世界杯竞技场:语言模型与深度研究代理的精细评估

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #Open Source

摘要

在足球比赛开始前进行预测不仅需要了解过去的结果,还需要模型能够利用变化的信息,并在答案可用之前做出明确的预测。我们提出了 WorldCupArena,这是一个针对语言模型和深度研究代理的动态基准测试。

基准测试概述

2026 年国际足联世界杯是其首个评估对象,未来的联赛和杯赛也可以重复使用相同的流程。在每场比赛之前,模型会接收一个通用证据包或自行搜索信息。它需要预测结果和比分、可能的球员和事件、比赛统计以及比赛结果。

评估指标

比赛结束后,模型的预测将与记录的结果进行比较。我们报告了结果准确率、精确比分准确率,以及一个得分线评分,当预测的比分接近但不完全准确时也会给予一些信用,此外还包括其他预测任务的得分。

在 104 场比赛和 13 个系统的评估中,结果准确率相似的模型在详细预测上差异更为明显。与投注市场和人类球迷基线相比,表现最好的系统在结果和精确比分准确率上仅有小幅提升,但在得分线上有显著提升。新赛季可以在开始时添加,从而使基准测试能够评估未来的模型,而不使用已经知道的结果。

代码、提示、预测和评估脚本均在 GitHub 上开源。

博主点评: WorldCupArena 的提出为未来的足球比赛预测提供了一个动态且可扩展的评估框架,尤其是在实时数据处理和模型适应性方面,值得关注。其开源代码也为研究者提供了宝贵的资源,促进了相关领域的进一步探索。

原文链接: https://arxiv.org/abs/2607.18084

[h] 返回首页