论文
先优化后评估:使用未优化提示词的评估可能产生误导
Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading
摘要
当前的大语言模型(LLM)评估框架在所有被评估模型上使用同一静态提示词模板。这与业界常见做法不同:业界通常使用提示词优化(PO)技术为每个模型优化提示词,以最大化应用性能。本文研究了提示词优化对LLM评估的影响。我们在公开学术基准和内部行业基准上的结果表明,提示词优化会极大影响模型的最终排名。这凸显了从业者在开展评估以选择给定任务最佳模型时,对每个模型分别进行提示词优化的重要性。
