论文
自我评估已经存在:用最少的数据在基础 LLM 中引发潜在的判断校准
Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data
摘要
大语言模型 越来越多地受到其他模型的评估,这就提出了一个自然的问题:模型能否预测法官将如何评分自己的输出?我们发现这种能力在任何有针对性的训练之前就已经存在了:在几次提示下,基本模型已经预测了外部法官在开放式回答上的多属性质量得分,远高于三个基准的机会。我们引入了自我评估启发(SEE),这是一种通过短周期展现这种潜在能力的方法,包括校准耦合强化学习阶段,该阶段改进答案并预测判断,然后是屏蔽 蒸馏 阶段,该阶段锐化预测,同时保持答案不变。 SEE 通过 160 个独特示例(大约比强化学习基线少 31 倍)改进了三个基准的保留校准,同时保持了答案质量。引发的自我评估在模型自身的词元分布中明显定位,并且在从未接受过训练的法官之间保持稳定,这表明质量的概念是可转移的,而不是单个法官的偏好。这些结果将与法官一致的自我评价重新定义为启发问题而不是获取问题。