论文
推理是否可以提高大型语言模型的心理深度?这取决于谁来评判
Does Reasoning Improve Psychological Depth in Large Language Models? It Depends on Who's Judging
摘要
大语言模型作为法官评估者越来越多地用于对开放式生成进行评分,但当输出紧密匹配并且人类偏好是主观的时,法官与其发展集上的人类评级的相关性可能无法保证有效的测量。我们通过短篇小说的心理深度来研究这种失败模式。在原始标量心理深度量表数据集 ($ρ= 0.646$) 上选择的七名人类读者和大语言模型法官团队评估了来自 GPT-5 与 GPT-4o 和 DeepSeek-R1 与 DeepSeek-V3 的 60 个盲法、提示匹配的故事对。人类偏好没有表现出普遍的推理优势:GPT-5 比 GPT-4o (60.0--62.9\%) 更受青睐,而 DeepSeek-R1 落后于 V3 (42.9\%),读者间的一致性几乎是偶然的 (Krippendorff 的 $α= 0.070$),读者内部的一致性和重复的加权模式表明结构异质性而不是随机响应。相比之下,法官在 89.0% 的维度级别比较和聚合 PDS 上的 60 对中的 59 个中倾向于推理输出,在所有五个评估器配置中一致,其分数与句子长度和词汇多样性等表面特征相关。这些结果表明,开发集性能不足以证明转移分布上的部署有效性,并且点估计法官可能会掩盖人类主观评估中的异质性。