无论如何进行自我清理和捕获:代理写入自身的存储中的一个测量错误原语,以及下降的分数实际测量的内容
Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures
摘要
“将其结论写入随后检索的存储中的代理会关闭一个通常被报告为单向污染的循环。将循环置于针对仅附加存储的无限保有限制会产生不同的情况:因为写入永远不会删除,所以可达状态空间在 (n-1)/n 处具有硬上边缘,因此结果是在两个边缘之间进行选择而不是衰减。在 f_0 = 0.9 时,两种模式之间的间隔保持 220 次运行的 3.6%,其中均匀分布将占 20.6%,并且在前 15 个数据上严格为空;汇集平均值描述了其汇总的 8.2%,中位数为 68.2%,模型贡献的所有内容均由一个没有拟合参数的测量原语(复制函数 \gamma(\phi):在 36 个 Wikidata 事实上,sign(\hat{\gamma} - \gamma_{crit}),其中 \gamma_{crit} = 来表示)。 1/k at r = 0, w = 1,预测 360 次真实运行中的 353 次的漂移方向(同一批次中 40 次合成中的 39 次):合并前沿捕获率为 0.850,而 claude-sonnet-4.5 在 20 个种子中的 20 个上捕获,与我们注册的预测值 <0.5 相比。间隔测试的是可区分性而不是计数:在真实事实上,多值运行的占用率是其余运行的 6.4 倍,在 f_0 = 0.5 时捕获峰值,并且在首先冻结标准的四种干预中,时序在匹配预算下占主导地位,而一致性门将每个模型驱动到 0.993。重采样单元是种子,在汇总水平上的设计效果为 3.75:在44 种子控制支持主张 4 的排序从 Spearman +0.98(三颗种子)下降到 +0.31-0.80(四十四颗),而主张 2 的排序是准确的(+1.00,p = 0.017)。所有 87 个分级行都在附录 W 中,其中 37 个分级为撤回、失败、自我更正、不可判定或公认的限制,而 50 个是不。”