论文
自相关盲点:为什么 LLM 对话分析中 42% 的回合级结果可能是虚假的
The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious
摘要
轮次级别指标广泛用于评估多轮人类 LLM 对话的属性,从安全性、阿谀奉承到对话质量。然而,对话中的连续回合在统计上并不独立——事实上,当前所有评估流程都无法在统计推断中进行纠正。我们系统地描述了 202 个多回合对话(11,639 个回合对、5 个德语用户、4 个 LLM 平台)中 66 个回合级别指标的自相关结构,并证明朴素的汇总分析会产生严重夸大的显着性估计:在标准汇总测试下表现出显着性的关联中有 42% 未能通过集群稳健校正。不同类别的膨胀率差异很大,而不是与自相关线性缩放:三个无记忆系列(嵌入速度、方向、差分)合计为 14%,而七个非记忆系列(热循环、帧距离、词汇/结构、滚动窗口、累积、交互、时间戳)合计为 33%,各个类别的比率从 0% 到 100% 不等,具体取决于每个系列的效应大小。我们提出了一个两阶段校正框架,将 Chelton (1983) 有效自由度与对话级块引导相结合,并在预先注册的保留分割上对其进行验证,其中集群鲁棒指标的复制率为 57%,而仅池化指标的复制率为 30%。我们提供具体的设计原则、发布清单和校正管道的开源代码。对最近在主要 NLP 和 AI 场所计算 LLM 评估中的轮级统计数据的约 30 篇论文进行的调查发现,只有 4 篇论文根本解决了时间依赖性,而 26 篇论文没有对此进行纠正。