论文
当信任遇上真相:LLM-as-Judge中的信任—真值可分性
When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge
摘要
LLM-as-Judge系统可以产出多维评估,例如可信度、可靠性和事实性,而这些输出常被解读为相互独立的证据。我们针对一对常见判断——信任打分与二元真值分类——检验这一假设。在正确性受控的问答数据上,LLM评委把信任分与真值判定对齐得比人类行为参照更紧,表明信任判断与真值判断之间的分离较弱。随后我们施加压力测试,仅改变同一批问答的来源线索(人类或AI)。来源归因不仅改变信任分,也改变真值判定以及由logit推导的正确侧概率。结果表明,当前的LLM-as-Judge协议不应把信任分当作真值判断的独立证据。
