LLM 代理之间的可认证语义协议:受理工具决定什么
Certifiable Semantic Agreement Among LLM Agents: What the Admissibility Instrument Decides
摘要
LLM 代理委员会能否达成可在含义层面(而不仅仅是标签层面)进行认证的协议?我们建立了一个协议来找出答案。 H-CSC 在通用 2f+1 不同签名者证书下每轮发出三种类型结果之一——语义提交、判决提交或类型中止,我们用它来衡量此类协议的成本和购买量。答案是有条件的,而条件不是协议。我们证明了一个包含引理:只要语义核心足够大,足以使提交的判决确定性地有效,判决边际就已经超过 f,因此在匹配的确定性保证下,不可能将覆盖范围与证书包装的多数分离。测量一致:两个规则提交相同的任务集。相反,重要的是可受理性文书。针对保留判决并仅破坏推理的对手,442 MB 微调编码器在 0-8% TPR(5% 诚实的 FPR)下达到 AUROC 0.621-0.744,而 无需训练 词汇谓词在 38-80% 时达到 0.865-0.982(50 个任务,200 次攻击,400 诚实),并且完全符合确定性的,释放摘要证明所依赖的假设。诚实代理的分散程度比攻击所取代的范围更远(90%诚实角距离为 0.992 rad,相对于 0.65 半径),因此根据自由文本原理,嵌入过滤器是不可行的——输出模式的一个属性,当其收紧时,分散程度会降低 20 倍。提交的摘要不是惰性的:在不披露的情况下,保留相似性的草图在 AUROC 0.741 (n=350) 处将忠实的与替换的派生语句分开,其中加密哈希和仅判决摘要的得分恰好为 0.500。我们还报告了我们自己的协议中发现的抢七捕获漏洞及其四行修复。我们声称与仅裁决认证相比,没有安全性或覆盖范围优势;引理解释了为什么没有可声明的内容。