国际象棋大语言模型的基准测试提示优化
Benchmarking Prompt Optimization of Large Language Models With Chess
摘要
随着大语言模型能力的进步,评估大语言模型变得越来越具有挑战性:基准可能会饱和,公共测试集存在污染风险,评估更困难的任务可能需要昂贵的分级或执行基础设施。这些挑战在自动提示优化 (APO) 中被放大,在寻找更好的提示的过程中会重复进行评估。因此,研究 APO 需要一个成本低廉且具有确定性的评分基准,足够坚硬以留出改进空间,并且可以随着模型的发展而更新。我们引入了一个由 1,118 个 Lichess 谜题构建的国际象棋基准来研究冻结的大语言模型的 APO:我们优化他们的提示而不更新他们的模型权重。国际象棋结合了廉价的精确匹配评分、基于引擎的替代动作评估以及可调整难度的可更新问题供应。与仅报告孤立测试项目成功的评估不同,该基准还将解决谜题的收益与同一领域内的简短游戏展示联系起来。我们用它来评估八个目标模型上的六种 APO 算法,不仅测量基线强度,还测量每个模型对优化的响应程度,以及优化的提示是否跨模型和游戏玩法转移。因此,国际象棋是 APO 的一个非常适合的基准:(i) 具有挑战性,因为即使是最强的评估模型 Gemini 3.5 Flash(用作元模型)也只能解决大约 55% 的谜题; (ii) 方法和模型之间的区别性、揭示性收益、不变的绩效以及回归; (iii) 可再生,具有新的谜题,可降低污染风险,并可调整难度,以随着模型的改进保持空间; (iv) 价格实惠,因为完整的研究费用约为 800 美元。我们发布了谜题、优化和评估代码以及数据集更新脚本(https://github.com/imec-ailabs/Automatic-Prompt-Optimization-with-Chess).