论文

我应该对我的 LLM 相关性判断有礼貌吗?语气作为严重性工作点的转变

Should I Be Polite to My LLM Relevance Judge? Tone as a Severity Operating-Point Shift

模型评测模型行为与机制分析

摘要

大语言模型越来越多地用作相关性评判,但标签可能随提示表面形式改变。我们在3498组TREC DL19/DL20查询—段落对上,比较八种评判模型、五级经分类器校准的礼貌程度和每级三种改写。效果强烈依赖模型:一种呈明显U形响应,多数变化较小。语气改变与人工标注的一致性时,结果更符合评判宽严程度的工作点移动,而非判断质量提高;移动接近或远离人工标注的严格程度会使一致性升降。不重叠查询的交叉拟合保留预期关联(Spearman相关系数−0.683,精确模型块置换p=0.019)。语气对校准一致性的影响大于排序结果:32组模型—语气比较中,NDCG@10平均变化绝对值最大为0.011,但Kendall τ最低0.743说明重排减少而非消失。这解释了既有矛盾发现,并指出当绝对相关性标签重要时,提示语气可能威胁评测有效性。