论文

跨越边界的响应漂移 大语言模型

Response drift across frontier large language models

模型评测模型行为与机制分析

摘要

所有前沿 大语言模型 (LLM) 都表现出响应漂移——产生的输出偏离专家验证的参考——但这种漂移的幅度和结构仍然没有通过系统的人类评估来表征。在此,我们报告了一项完全交叉的评估,其中 47 名来自不同地理位置的参与者在盲法条件下分别评估了 10 个前沿 LLM 的所有 62 个多领域问题,得出了 29,140 项独立评估。每个模型都会漂移,但漂移幅度差异很大:八个模型收敛在统计上无法区分的上限(78-81% 偏差),而两个模型实现较低的偏差(47-49%)。漂移曲线在 6 个领域和 62 个问题中存在差异,上限模型之间的成对相关性超过 r = 0.85。自动相似性度量可以解释人类判断中不到 2% 的差异。这些发现表明,响应漂移在整个前沿 LLM 中是普遍存在的,在结构上依赖于领域和问题,并且只能通过以人为中心的评估来实现。