论文
代理 Kubernetes 操作的测量基础:检索复合伪造的方法论和案例研究
A measurement substrate for agentic Kubernetes operations: Methodology and a case study in retrieval-compounding falsification
摘要
关于自治 Kubernetes 操作代理的经验主张在很大程度上是不可证伪的。已发表的工作报告了观察结果,没有与代理禁用的基线进行受控比较,选择偏差普遍存在,缺乏预先注册的决策矩阵,并且对于基础评分系统的噪音水平而言,样本通常太小。原因与限制代理本身的差距相同:代码代理有一个验证基础,可以将“它工作了吗”转变为快速、可证伪的 真值 信号,而操作没有任何等效的东西。我们提出了代理破坏,这是一个闭环测量框架,它将故障注入到目标 Kubernetes 集群中,观察自主代理如何响应,根据 真值 在四个轴上对响应进行评分,并累积结果标记的(状态、操作、结果)元组。该框架区分框架错误和推理错误,通过确定性嵌入器机制支持真正的关闭条件控制,并强制执行预先注册的决策矩阵。我们用它作为案例研究来测试对过去事后分析的检索是否会增强特工的能力。方法有效负载是在该案例研究中发现的三个混淆底物,其中每一个都会对同一工作的仪器较少的版本产生错误的已发表声明:pgvector 索引错误、+19%的选择偏差伪影以及小样本估计将影响夸大了大约 3 倍。检索结果本身是部分伪造的:3 个密集语料库场景中的 1 个在 p<0.05 时显着,合并效应 +3.9 个百分点,在 n=60 时不显着。 360 次运行的场景内语料库密度扫描表明,近邻的机械对齐在原始计数中占主导地位。该框架已开源发布。