论文
标签效应:人类与LLM-as-a-Judge信任评估中共享的启发式依赖
Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
摘要
大语言模型(LLM)正日益被用作自动评估器(LLM-as-a-Judge)。本工作通过展示LLM的信任判断会受披露的来源标签偏置影响,对其可靠性提出质疑。利用反事实设计,我们发现人类与LLM评判者对标注为人类创作的信息给予比标注为AI生成的相同内容更高的信任。眼动数据揭示,人类严重依赖来源标签作为判断的启发式线索。我们分析了LLM在判断过程中的内部状态。在各标签条件下,模型对标签区域分配的注意力密度高于内容区域,且这种标签主导性在人类标签条件下强于AI标签条件,与人类注视模式一致。此外,以logits衡量的决策不确定性在AI标签条件下高于人类标签条件。这些结果表明,来源标签对人类和LLM而言都是显著的启发式线索。这为标签敏感的LLM-as-a-Judge评估提出了效度担忧;我们也谨慎地提出,将模型与人类偏好对齐可能把人类的启发式依赖传播进模型,这为去偏评估与对齐提供了动因。
