论文

文档大海捞针中的语义针:LLM-as-a-Judge 相似性评分的敏感性测试

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

模型评测评测方法与指标

摘要

我们提出了一个可扩展的多因素实验框架,系统地探讨 LLM 对成对文档比较中微妙语义变化的敏感性。我们将其类比为大海捞针问题:单个语义改变的句子(针)嵌入周围的上下文(干草)中,并且我们改变扰动类型(否定、合取交换、命名实体替换)、上下文类型(原始与主题不相关)、针位置和所有组合中的文档长度,在数万个文档对上测试五个 LLM。我们的分析揭示了几个惊人的发现。首先,LLM 表现出与先前研究的候选顺序效应不同的文档内位置偏差:当语义差异出现在文档中较早的位置时,大多数模型会更严厉地惩罚它们。其次,当改变的句子被主题不相关的上下文包围时,它会系统地降低相似性分数并引发两极分数,表明相似性非常低或非常高。这与解释框架的解释是一致的,在解释框架中,主题相关的上下文可能允许模型将更改置于上下文中并降低其权重。第三,每个 LLM 都会产生一个定性独特的评分分布,一个对扰动类型不变的稳定“指纹”,但所有模型在对待不同扰动类型的宽松程度方面都共享一个通用的层次结构。总之,这些结果表明,LLM 语义相似性分数对文档结构、上下文连贯性和模型身份的敏感程度超出了语义变化本身,并且所提出的框架提供了一个实用的、与 LLM 无关的工具包,用于审核和比较当前和未来模型的评分行为。