机械化用户的眼睛:在生产LLM智能体运行时中预先注册部署经过破坏验证的可能失败的观察器
Mechanizing the User's Eye: Pre-Registered Deployment of a Sabotage-Validated Fail-Plausible Observer in a Production LLM Agent Runtime
摘要
先前对生产LLM智能体运行时中的无声故障的纵向研究 (arXiv:2606.14589) 发现,大约 70% 的故障是由人类以用户身份查看产品时发现的,而数千次测试和治理检查仍然保持绿色,并将人眼所做的部分机械化视为一个开放问题。本文报告了我们的尝试。我们构建了一个自动化的用户观点观察器,针对最危险的类别、看似可能失败的故障,其中内部错误变成流畅的、看似合理的输出给用户。它是一个两层管道:从事件事后分析中提取的五个确定性信号升级到LLM法官,其裁决必须引用逐字证据,否则将被丢弃。基本事实是 24 个带有明确诚实边界的标记生产事后分析:24 个中的 16 个在结构上对于任何内容阅读观察者来说都是不可见的,我们是这么说的。离线时,确定性层实现 6/6 回归检测,误报率为 0/4,每个检测器均被证明可承受破坏;新模式上的留出召回率是 0/4。到目前为止,它是一个回归引擎。部署是在预注册之后进行的:影子模式在第一次运行时捕获并退出了一个系统性误报,然后 26 天的影子窗口运行干净,翻转标准在读取影子数据之前固定,分析协议在强制模式窗口打开之前被冻结。该窗口期(观察 12 天)做出的判决为零;根据预先注册的路径,我们将实时精度报告为未定义,而不是将安静描述为成功。观察者还产生了自己的十个无声的失败,证实了法官继承了它所判断的分类法。我们发布了语料库、探测器和记分卡作为可运行的工作台:今天的机械化淘汰了人类的回归扫描,因此眼睛可以专注于新奇事物;预测仍然开放,但现在可以根据冻结的规则进行衡量。