论文

当信任遇上真相:LLM-as-Judge中的信任—真值可分性

When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge

模型评测模型行为与机制分析

摘要

LLM-as-Judge系统可以产出多维评估,例如可信度、可靠性和事实性,而这些输出常被解读为相互独立的证据。我们针对一对常见判断——信任打分与二元真值分类——检验这一假设。在正确性受控的问答数据上,LLM评委把信任分与真值判定对齐得比人类行为参照更紧,表明信任判断与真值判断之间的分离较弱。随后我们施加压力测试,仅改变同一批问答的来源线索(人类或AI)。来源归因不仅改变信任分,也改变真值判定以及由logit推导的正确侧概率。结果表明,当前的LLM-as-Judge协议不应把信任分当作真值判断的独立证据。

当信任遇上真相:LLM-as-Judge中的信任—真值可分性:论文配图
图1:研究概览。我们跨领域构建带有来源反事实版本的、正确性受控的问答对。LLM和人类评判者对每个条目给出两种判断:信任分数和二值真值判定。我们比较人类与LLM的信任–真值关系,然后将来源归因作为压力测试,检验在信任相关扰动下LLM的信任判断与真值判断是保持可分离还是一同偏移。