论文

迈向可靠、实用的评测流水线

Towards a Reliable and Practical Eval Pipeline

模型评测评测方法与指标

摘要

基于LLM的软件系统越来越需要有效的“评估”作为开发生命周期中的质量关卡。然而,现有的工作通常涉及评估可靠性的各个方面,而不是全套的实际要求。我们提出了一个端到端的评估管道,它将评估清单创建与清单响应的学习聚合相结合,以提高LLM法官之间的一致性和针对人类判断的准确性。该框架还提供了自洽性、解释和预测不确定性,我们凭经验证明了其有效性。

迈向可靠、实用的评测流水线:论文配图
图1:我们的反弹管道。向一个大型语文模式发送一份 " 是 " / " 不 " 反弹问题核对表,并附上对评价的投入。在这个例子中,评价评估总结的质量,因此文件及其相应的摘要构成我们的额外投入。大语言模型的产出被发送到一个表格模式,例如 " 渐进推力决定树 " ,以得出最后评分。还提出了解释和某种形式的信任分数。详情见§3。