论文

先优化后评估:使用未优化提示词的评估可能产生误导

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

模型评测评测方法与指标

摘要

当前的大语言模型(LLM)评估框架在所有被评估模型上使用同一静态提示词模板。这与业界常见做法不同:业界通常使用提示词优化(PO)技术为每个模型优化提示词,以最大化应用性能。本文研究了提示词优化对LLM评估的影响。我们在公开学术基准和内部行业基准上的结果表明,提示词优化会极大影响模型的最终排名。这凸显了从业者在开展评估以选择给定任务最佳模型时,对每个模型分别进行提示词优化的重要性。

先优化后评估:使用未优化提示词的评估可能产生误导:论文配图
图1:仅指令优化(PO)后各模型在数据集上的排名变化,上排为开源数据集,下排为内部数据集。