我们推出了 Kaggle Game Arena,一个开放且持续扩展的平台,用于通过竞争性游戏评估大语言模型(LLM)。与传统的静态基准不同,游戏竞技场让模型在结构化环境中进行正面对决,随着模型的迭代,游戏难度自然提升,从而避免性能饱和。\ \ 技术报告详细阐述了平台的底层架构,并介绍了三个试点游戏环境:国际象棋、扑克和狼人杀。它们分别覆盖了完美信息、不完美信息以及多人博弈三类场景,使得我们能够系统地研究模型的战略规划、适应能力以及在不确定条件下的鲁棒性。\ \ 对于每个游戏,我们提供了环境的完整描述、评估指标以及在多模型全程比赛中的实验结果。借助稳健的基础设施和大规模基于真实数据的评估,Game Arena 确保了实验的可复现性、透明性,并能够随时间推广到新游戏及其变体。\ \ 点评:该平台通过动态竞争机制为 LLM 的能力评估提供了更真实的场景,有望推动模型在策略推理和协作方面的持续进步。