论文

PReMISE:作为LLM裁判测量规范的策略级评分细则

PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges

模型评测评测方法与指标

摘要

LLM裁判越来越多地被用于评估开放式回答,但其评分高度依赖于约束它们的评分细则(rubric)。一条要求回答“有帮助且符合事实”的模糊细则,可能会奖励那些编造事实或违背用户意图的精致回答。我们将可复用的评分细则视为测量规范:改变细则就会改变固定裁判所导出的回答质量测量。我们提出PReMISE框架,在给定成对人类偏好数据的条件下:(i)发现一套策略级评分细则集;(ii)沿结构充分性、可靠性、偏好拟合度与对抗鲁棒性四个维度,审计任何评分细则集在LLM裁判使用下的表现。在各评分细则来源中,没有任何原始来源能同时做到可靠、可预测偏好且具备对抗鲁棒性;而且评分者间的高一致性并不意味着低可利用性。PReMISE是唯一在适用性、特异性与有效维度上同时获得非平凡得分的评分细则来源。我们贡献了两种面向审计的修复操作:偏好排序选择将裁判在成对回答上的准确率从$65.0\%$提升到$68.6\%$,与最强的评分细则发现基线相当,并在跨裁判扫描中于三个裁判中的两个上领先;可靠性约束的精炼将利用性回答获得高分的比率从$46.4\%$降至$36.0\%$,而裁判间一致性几乎不变($α{=}.531\to.519$)。

PReMISE:作为LLM裁判测量规范的策略级评分细则:论文配图
图 2:PReMISE 框架。政策量规、成对偏好数据集和固定的判断协议定义了以量规为条件的测量过程。 PREMISE 沿着四个轴(结构充分性、可靠性、偏好适合度和对抗稳健性)对法官进行审核,并使用审核失败来指导评估标准的选择或细化。