NeFut Logo NeFut
EN 管理员登录

[AI学术] DiG-bench:游戏中的发现

发布于:2026-08-15 22:00 最后更新:2026-08-16 07:03
#AI #Machine Learning #Discovery

发现,即提出新的普遍性概括,是科学过程的核心部分。尽管其重要性,当前的人工智能基准测试领域存在空白,直接探测在受控环境中通过实验发现新知识的能力的基准测试很少。为了填补这一空白,我们发布了一项新基准测试:DiG-bench(游戏中的发现)。DiG-bench由一套70个独立的游戏组成,每个游戏都编码为一个短字符串,并且具有必须通过交互和实验发现的独特转换规则。游戏的关卡呈现了一系列挑战,以测试是否发现了规则,每个关卡的获胜条件也是未知的。我们为人工智能代理提供了七个难度级别的游戏。最低级别可以被多个模型轻松解决,而最高级别则挑战了最好的模型。所有70个游戏都至少被一名人类在第一次尝试中解决。其中21个游戏公开发布,剩余的游戏被保密以进行安全评估。 博主点评: DiG-bench基准测试为人工智能代理提供了一个发现和实验的平台,能有效地评估其学习和适应能力。通过游戏化的方式,研究人员可以更好地理解人工智能模型的发现能力,推动人工智能领域的发展。

原文链接: https://arxiv.org/abs/2608.12593

[h] 返回首页