论文

超越表面判断:对大语言模型产生的虚假信息进行人性化风险评估

Beyond Surface Judgments: Human-Grounded Risk Evaluation of LLM-Generated Disinformation

模型评测模型行为与机制分析

摘要

大语言模型(LLM)可以大规模生成有说服力的叙述,引发人们对其在虚假信息活动中潜在用途的担忧。评估这种风险最终需要了解读者如何接收此类内容。然而,在实践中,大语言模型法官越来越多地被用作直接人工评估的低成本替代品,尽管他们是否忠实地跟踪读者的反应仍不清楚。我们将这种情况下的评估重新定义为代理有效性问题,并根据人类读者的反应审核大语言模型的法官。使用 290 篇对齐的文章、2,043 配对的人类评分以及八位前沿评委的输出,我们在总体评分、项目级排序和信号依赖性方面检查了评委与人类的对齐。我们在整个过程中发现了持久的判断力——人为差距。相对于人类,法官通常更加严厉,只能微弱地恢复项目级别的人类排名,并且依赖于不同的文本信号,更加重视逻辑严谨性,同时更强烈地惩罚情感强度。与此同时,法官之间的共识远多于人类读者的共识。这些结果表明,大语言模型法官形成了一个连贯的评估小组,其内部比与人类读者更加一致,这表明内部一致意见并不是作为读者反应代理的有效性的证据。