论文
将评判者编纂为程序:通过程序蒸馏实现可扩展评估
Codifying the Judge: Scalable Evaluation via Program Distillation
摘要
LLM作为评判者已成为自动化评估的标准,但它存在成本高、推理延迟和不透明决策的问题——这些局限削弱了其可扩展性与可靠性。我们用一个简单高效的替代方案来解决:程序蒸馏。我们不再在评估时提示LLM,而是把其决策逻辑蒸馏为一组程序组成的委员会,由它们直接为候选打分。这些程序化评判者具有透明性,易于检查或修改,并消除了每样本的API成本。基于这一理念,我们引入PAJAMA,一个将程序合成为评判者、把它们的决策聚合为联合裁决、并引入回退机制以选择性地将低置信度案例升级给LLM的系统。在五个数据集和八个模型家族上,我们证明程序化评判者能以47倍的更高吞吐匹配13B规模LLM评判者的性能。当把程序输出用作路由信号时,PAJAMA同时提升准确率与吞吐量,并推进了帕累托前沿。除评估之外,程序化评判者还能产生廉价而有效的奖励信号:在RewardBench上,从程序裁决蒸馏出的奖励模型,以低两个数量级的API成本胜过在专有LLM标签上训练的奖励模型。
