论文

选择哪个LLM?大语言模型的在线主动模型选择

Which LLM to pick? Online Active Model Selection for Large Language Models

AI 基础设施模型网关

摘要

大语言模型 (LLM) 越来越多地应用于处理流数据,从业者依靠基准来选择最佳模型,即使这些信号仅接近真实性能。虽然预言机注释可以提供可靠的反馈,但它们通常成本高昂且难以大规模获得。为了应对这一挑战,我们提出了在线大语言模型选择器,这是在线环境中大语言模型主动模型选择的第一个框架。给定任意的查询流和有限的注释预算,ONLINE LLM PICKER 会选择信息最丰富的注释提示,以在候选模型中识别最佳的 LLM。在包括 10 个数据集在内的多个任务中,针对 130 多种语言模型,我们表明 ONLINE LLM PICKER 可以节省高达 71.67% 的注释成本,同时可靠地识别流的最佳或接近最佳模型。我们还表明,使用返回的模型对流中未注释的提示进行顺序生成可将遗憾减少高达 2.51 倍,这表明 ONLINE LLM PICKER 可以在处理所有流提示之前识别最佳或接近最佳的模型。