论文

相似性门批准逆转:代理系统中嵌入余弦阈值的有效性审核

Similarity Gates Approve Reversals: A Validity Audit of Embedding-Cosine Thresholds in Agent Systems

模型评测评测方法与指标

摘要

代理框架提供质量门,通过嵌入余弦相似性来比较文本块,并在固定的截止点上做出决定。重复数据删除过滤器、语义缓存、漂移防护和答案分级器门的部署是为了回答这个问题:“这个文本仍然意味着同样的事情吗?”但分数回答了一个不同的问题:“措辞改变了多少?”我们将此门类作为测量工具进行审核。在这些门的存在是为了捕捉的情况下,两者可以以相反的方式运行。很多时候,逆转指令只是一个单词的编辑,而协议通常是改写一个句子。其结果是安全检查发生倒退。我们审核的生产漂移防护捕获了 56 个意义破坏突变中的 0 个,并且一项批准的项目“扣留研究药物”->“施用研究药物”的余弦值为 0.9608。我们观察到 5 个已发货的操作点,并且 90 个配置阈值任务单元的平衡精度从未超过 0.700(中位数 0.525)。同样的混杂因素也破坏了评估结果。一个简单构建的语料库继承了这个混杂因素,并且可以返回一个相反的结论,在 18 个配置任务单元中的 13 个中,决策 AUROC 恰好为 0.000(所有 18 个中最多为 0.040),而在平衡 2x2 设计下,相同的 9 个配置的决策 AUROC 为 0.440-0.815。经过努力,它两次占据了我们自己的头条新闻。明显的修复失败了:编码器交换和重叠条件门(0.750 样本内,0.533 保留)偶然落在单独编写的保留数据上,而 NLI 插入也没有做得更好。嵌入在这里仍然充满希望,因为九个配置中最强的两个在匹配重叠处将反转与释义分开(AUROC 0.79-0.90),但只有匹配对审计才能揭示部署机制。我们发布了语料库方法、利用和冻结结果,并认为以这种方式门控的分数测量了错误的东西。我们相信有效的工具是可以构建的。