论文

将评判者编纂为程序:通过程序蒸馏实现可扩展评估

Codifying the Judge: Scalable Evaluation via Program Distillation

模型评测评测方法与指标

摘要

LLM作为评判者已成为自动化评估的标准,但它存在成本高、推理延迟和不透明决策的问题——这些局限削弱了其可扩展性与可靠性。我们用一个简单高效的替代方案来解决:程序蒸馏。我们不再在评估时提示LLM,而是把其决策逻辑蒸馏为一组程序组成的委员会,由它们直接为候选打分。这些程序化评判者具有透明性,易于检查或修改,并消除了每样本的API成本。基于这一理念,我们引入PAJAMA,一个将程序合成为评判者、把它们的决策聚合为联合裁决、并引入回退机制以选择性地将低置信度案例升级给LLM的系统。在五个数据集和八个模型家族上,我们证明程序化评判者能以47倍的更高吞吐匹配13B规模LLM评判者的性能。当把程序输出用作路由信号时,PAJAMA同时提升准确率与吞吐量,并推进了帕累托前沿。除评估之外,程序化评判者还能产生廉价而有效的奖励信号:在RewardBench上,从程序裁决蒸馏出的奖励模型,以低两个数量级的API成本胜过在专有LLM标签上训练的奖励模型。

将评判者编纂为程序:通过程序蒸馏实现可扩展评估:论文配图
图 1:综合程序化法官的示例。给定综合提示(左上),LLM 会生成一个 Python 判断函数,该函数使用可解释的特征(例如通过 TF 向量余弦相似性实现的语义漂移或跨篇章的主题一致性)来阐明评估标准(例如逻辑连贯性)。这些特征被组合成一个加权分数,并对矛盾和截断进行明确的惩罚,其中权重由大语言模型本身确定。这产生了一个透明的、基于程序的评估器,直接从大语言模型的推理中提炼出来。