论文
测量 LLM 通信环路中的结构漂移
Toward Measuring Structural Drift in LLM Communication Loops
摘要
大语言模型 越来越多地在有状态管道中运行,这些管道从检索、内存、工具和其他代理中组装每个提示。这样的管道会发生漂移:应该形成下一个响应的信息被丢弃、压缩或错误路由,而每个组件仍然报告成功。现有的诊断忽略了这一点,因为它们评估孤立的提示、响应或任务分数,而解耦的是提示与其绘制的响应之间的关系。在这里,我们表明,将对下一个提示链的响应的提示视为分析的基本单位使得这些关系是可测量的。我们引入了结构通信一致性,通过两个指标来量化:通信闭合,它询问管道在一轮返回的内容是否与它接下来面临的内容相匹配,以及标准化条件动作贡献,它衡量发送的消息解决后续回复的程度。在 2,171 个人与人、58 个人与 LLM 以及 8 个 LLM 与 LLM 对话中,这些指标揭示了定向交互结构;至关重要的是,当一个响应被替换为另一个回合的响应时,测得的贡献会下降 87% 到 92%,而周围的提示保持不变。由于这种方法不需要标签、健康的参考数据或预定义的规则,因此只能直接从操作流量中定义和测量原始提示和响应漂移,而不是从最终的任务失败中推断出来。下一步是建立前瞻性检测性能。