NeFut Logo NeFut
EN 管理员登录

[AI学术] 使用国际象棋评估大语言模型的提示优化

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #optimization

评估大语言模型的能力日益困难:基准容易饱和,公开测试集可能被污染,评估更难任务需要昂贵的评分或执行环境。这些问题在自动提示优化(APO)中更为突出,因为搜索更好提示的过程需要反复评估。为此我们构建了一个基于 1,118 盘 Lichess 谜题的国际象棋基准,用于冻结模型的 APO 研究,即在不更新模型权重的前提下优化提示。

国际象棋基准具备三大优势:

我们在八个目标模型上测试了六种 APO 算法,除了基线强度,还测量了每个模型对优化的响应程度、优化提示在不同模型间的迁移性以及在实际对局中的表现。最强模型 Gemini 3.5 Flash(作为元模型)仅解出约 55% 的谜题,表明基准仍具挑战性。实验整体花费约 800 美元,展示了成本可控。

代码、数据以及用于生成新题目的脚本已在 GitHub 开源: https://github.com/imec-ailabs/Automatic-Prompt-Optimization-with-Chess。

点评

原文链接: https://arxiv.org/abs/2610.00416

[h] 返回首页