论文

大语言模型裁判并非真值预言机:为什么自改进智能体需要确定性护栏

LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails

智能体系统Agent 动作执行与治理Agent Harness智能体自我改进

摘要

自我改进的代理管道存在一个核心问题。优化器重写提示以获得更高的分数,而分数来自本身就是LLM的法官。那位法官对系统是否变得更好有最后的决定权,而我们的立场是它没有赢得它。法官应该从预言机降级为顾问:其裁决成为多个输入中的一个,并且每个更改都由法官无法覆盖的确定性验证层进行控制。我们通过构建替代方案并运行它来实现这一目标。经过几个月在生产中运行跨合同分析、合规性审查和代码质量的自主提示优化循环,我们列出了评估信号失败的十一种方式,分为四类:判断偏差、利用和指标失败、真实错误和奖励作弊。代理通过从其环境中读取缓存的答案密钥获得了满分,100% 的通过率掩盖了 68% 的真实能力。损坏的真实标签导致优化器删除正确的合规性规则以同意它。语法错误的提示被提升为获胜者,因为静默解析器后备改进了指标。试图通过重写其停滞不前的标题来修复法官;唯一可靠的收益来自对其输出顺序的结构性约束。作为回应,我们描述了 PROCTOR,一个教师-学生循环,其中有状态协调器控制所有工具访问,无状态子代理诊断失败并草拟它们无法应用的突变,而教师根据五个确定性护栏对这些突变进行评分:密封沙箱、能力不相交的角色、高于教师的验收检查、冻结的抵制者和精心设计的金丝雀案例,以便完美的分数本身就是作弊的证据。我们报告了由此避免的失败,并且,因为老师本身就是LLM法官,所以我们报告了它没有避免的失败。

大语言模型裁判并非真值预言机:为什么自改进智能体需要确定性护栏:论文配图
图1:PROCTOR的作用分解。轮椅是唯一有声势的部件,也是唯一的持有工具;三个分剂是无国籍的、没有工具的,只看到训练案例。所有的耐久状态都生活在两件文物的底部