论文

大语言模型 带有限注释的选择

Large Language Model Selection with Limited Annotations

模型评测评测方法与指标

摘要

为给定任务选择 大语言模型 (LLM) 需要比较许多强大的候选者,但标准评估依赖于固定评估集上昂贵的注释。为了应对这一挑战,我们开发了 SELECT-LLM,这是第一个用于 LLM 主动模型选择的框架。 SELECT-LLM 旨在找到一小组查询,其注释对于识别给定任务的最佳 LLM 来说信息最丰富。为此,我们引入了基于预期信息增益的查询选择规则,该规则是根据候选模型输出之间的成对相似性计算得出的。由于此规则仅使用生成的模型响应,因此可以跨候选模型应用 SELECT-LLM,而无需对其架构或模型权重的访问进行假设。这使得它适用于开放重量和黑盒 LLM。我们在 23 个数据集、156 个评估模型、不同的任务系列和多个文本评估指标中评估 SELECT-LLM。在所有实验中,SELECT-LLM 在每种设置中都比最强基线有所改进,最佳模型选择的注释成本降低高达 81.8%,接近最佳模型选择的注释成本降低高达 84.78%。