论文
不可自行决定:LLM无法划定智能体验证者可以检查的边界
Not Self-Decidable: LLMs Cannot Draw the Boundary of What an Agent Verifier Can Check
摘要
智能体的验证者面临两种规则:固定检查可以解决的规则和需要判断的规则。一个团队派生出自己的检查,修复了预先分裂的问题。当需求来自外部时,例如在金融、医疗保健和法律领域,智能体会强制执行它没有编写的规则,因此划分会落到运行时,以审核者无法审核的速度针对每个操作的每个规则的每个谓词重复出现。每个升级方案都假设模型可以自行做出决定,并且可以自行决定。在六个语料库中,包括欧盟人工智能法案、FINRA 指南和已部署的信用智能体,我们从三个实验室构建的四个模型中收集了大约 22,000 个标签。他们几乎完全同意答案是显而易见的,但在监管文本上却崩溃了;它们的误差方向相反,因此没有任何模型可以被信任作为保守的选择;在部署的智能体自己的规则集上,他们一起犯了错误,过度声称固定检查就可以,而这个方向永远不会升级。我们引入了 CoVer (corroborate-then-verify),它将一致视为提名,只有当为其合成的检查在干预中幸存下来时才承认谓词,读取智能体无法写入的字段并在确定性重写下保存。这扇门拒绝了大部分证实错误承认的内容,但代价是我们报告而不是回避的报道。显而易见的替代方案是与参考法官达成一致,但不能证明任何事情:它在整个校准范围内从 30% 攀升至 77%,而真正可确定的份额却没有变化,因为从被起诉人群中选出的法官认可了其共有的盲点。自判定性不是从模型中得出的能力,而是验证者必须构建的边界。