论文

RPRA:预测LLM裁判以实现高效且高性能的推理

RPRA: Predicting an LLM-Judge for Efficient but Performant Inference

模型推理测试时计算扩展

摘要

大语言模型(LLM)面临计算效率(如参数量)与输出质量之间的根本性权衡,尤其是在部署于手机或笔记本等计算受限设备时。解决这一挑战的一种方式是效仿人类,让模型在认为自己无法独立解决问题时寻求帮助;我们可以让小模型在相信自己能给出良好回答时响应查询,而在不自信时转交更大的模型,从而克服这一权衡。为此,本文研究了Predict-Answer/Act(PA)与Reason-Predict-Reason-Answer/Act(RPRA)范式的可行性,模型在响应之前预测LLM裁判将如何为其输出打分。我们评估了三种方法:零样本预测、使用上下文内成绩单(report card)进行预测,以及监督微调。结果表明,较大的模型(尤其是推理模型)在零样本预测通用LLM裁判时表现良好,而较小的模型在经过微调或获得上下文内成绩单后也能可靠地预测此类裁判。总体而言,两种方法都能大幅提升较小模型的预测准确率,成绩单与微调在各数据集上分别带来最高55%和52%的平均提升。这些发现表明模型能够学会预测自身的性能局限,为更高效、更具自我意识的AI系统铺平道路。

RPRA:预测LLM裁判以实现高效且高性能的推理:论文配图
图 1:报告卡框架概述。询问会发送给多个LLM,他们的回答由LLM/代理法官联合评估。法官的回答被转换成成绩单,记录模型在不同查询类型上的表现。在推理时,模型会预测自己回答新查询的能力,从而能够经济有效地路由到能力最低的模型,而不会出现直接自我评估的过度自信的特征。