论文
通用悬崖和设计指纹:LLM 编排下的横截面缺陷检测
A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration
摘要
生产语言模型系统通过将请求划分到无形的工作代理编排中来响应请求,这些工作代理重新组成一份集成报告。我们要问,这对于单个工人看不到的一类缺陷有何影响:文档中两个相距较远的部分之间的关系存在矛盾。固定文档、缺陷、机制、评分和种子后,我们只改变模型——来自一个开发人员的五代十个系统和来自不同对齐范式的五个提供商。两层分开。首先,通用检测悬崖:在单个代理下发现这些横截面缺陷的每个模型在编排下都会失去这种能力,在每个测试的范式中检测下降三分之二或更多。悬崖是由机制产生的,而不是通过规模或扩展推理来封闭的。其次,模型跌倒后的表现如何。信号检测分解表明,在区分上述机会的六个模型中,只有一个开发人员的世代沿着报告标准轴移动:随着对齐的加强,该模型错过的缺陷越来越少,但对干净文档提出了更多的误报——一个标准的两个方面发生了变化,随着该开发人员内部的代际变化而变化(p < 0.001),而在其他地方几乎不存在。在地板上,遗漏的缺陷通常不会消失:模型的私人记录准确地重建了结构故障,而综合报告则签署了其健全性、对工件和缺席合作者的关注。这阻碍了量化——自动判断不稳定(精度为 17-50%),并且关键字无法将其与普通协议区分开来——我们将这一阻力作为发现报告。我们发布所有运行、探针、缺陷键、记分器提示和脚本。综合报告的置信度无法提供跨分区缺陷的信息,最一致的系统并不是最安全的,而且悬崖是结构性的。