论文
FormalJudge:面向Agentic监督的神经符号范式
FormalJudge: A Neuro-Symbolic Paradigm for Agentic Oversight
摘要
随着基于 LLM 的智能体日益在具有现实后果的高风险领域运行,确保其行为安全变得至关重要。主导性的监督范式 LLM-as-a-Judge 面临一个根本困境:概率系统如何能在不继承其失败模式的前提下可靠地监督其他概率系统?我们主张,形式化验证为摆脱这一困境提供了有原则的出路,但其采用一直受制于一个关键瓶颈:从自然语言需求到形式化规约的转换。本文通过提出 FormalJudge 来弥合这一缺口——一个神经符号框架,采用双向的 Formal-of-Thought 架构:LLM 充当规约编译器,自顶向下将高层人类意图分解为原子化、可验证的约束,再自底向上使用 Dafny 规约和 Z3 可满足性模理论(Satisfiability Modulo Theories,SMT)求解来证明合规性,从而产生数学保证而非概率分数。我们在涵盖行为安全、多领域约束遵循和智能体向上欺骗检测的三个基准上进行验证。在 7 个智能体模型上的实验表明,FormalJudge 相比 LLM-as-a-Judge 基线平均提升 16.6%,实现弱到强泛化——7B 判别模型检测 72B 智能体欺骗的准确率超过 90%,并通过迭代细化提供近线性的安全提升。
