评估大语言模型的能力日益困难:基准容易饱和,公开测试集可能被污染,评估更难任务需要昂贵的评分或执行环境。这些问题在自动提示优化(APO)中更为突出,因为搜索更好提示的过程需要反复评估。为此我们构建了一个基于 1,118 盘 Lichess 谜题的国际象棋基准,用于冻结模型的 APO 研究,即在不更新模型权重的前提下优化提示。
国际象棋基准具备三大优势:
- 通过精确匹配得分,评估成本低且结果确定;
- 可使用棋局引擎对备选走法进行评估,提供细粒度反馈;
- 题目可再生且难度可调,随模型提升保持空间。
我们在八个目标模型上测试了六种 APO 算法,除了基线强度,还测量了每个模型对优化的响应程度、优化提示在不同模型间的迁移性以及在实际对局中的表现。最强模型 Gemini 3.5 Flash(作为元模型)仅解出约 55% 的谜题,表明基准仍具挑战性。实验整体花费约 800 美元,展示了成本可控。
代码、数据以及用于生成新题目的脚本已在 GitHub 开源: https://github.com/imec-ailabs/Automatic-Prompt-Optimization-with-Chess。
点评