论文
JudgeSense:LLM 法官系统提示灵敏度的基准
JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems
摘要
大语言模型 被广泛用于判断其他语言模型的输出,但当相同的请求措辞不同时,法官是否返回相同的判决仍然很大程度上未经检验。我们通过四项评估任务和来自六家提供商的二十五名评委来研究这个问题。为了支持分析,我们发布了 JudgeSense,这是来自人工标记语料库的 880 个项目的基准,每个项目都根据两条措辞不同但要求不同的指令发布,并带有完整的决策日志。每个分数都是根据法官在同一提示上与自己达成的一致来报告的,因此解码噪音不会被计入措辞中,并且该新闻稿允许读者向不在我们名册中的任何法官提出同样的问题。重新措辞需要在所有四项任务上达成一致,而在两项任务上,它清除了我们宣布的具有实际意义的效果的门槛;序数任务既是最不稳定的,也是准确的法官最少的,并且在单个族中参数计数并不能预测稳定性。在代理工具内部测量的判断产生的估计值比通过直接 API 调用得出的相同判断值要小,因为它与自身的一致性比它在措辞之间的一致性崩溃得更快。