论文

使用见证的解决方案配置文件诊断 LLM 代理中的实时策略内指令冲突

Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles

模型评测评测方法与指标

摘要

LLM 代理受长期自然语言提示策略的约束,但单独合理的长期规则可能会以未经检查的方式进行交互。我们研究实时策略内规则冲突诊断:在单个提示策略中寻找可以共同治理现实状态的规则对,并衡量模型如何解决响应或工具操作中的压力。我们引入了 WIRE,一种见证的策略内规则评估管道。 WIRE 提取基于源的规则,将它们编码为 PyRule 子句,使用可满足性检查来保留同表面硬碰撞候选者,将这些候选者实现为具体的共同治理见证人,并根据原始源规则文本判断模型输出。在六个公共提示策略中,WIRE 提取了 276 个源规则和 560 个原子子句,对 30,944 个策略内子句对比较进行分类,保留 170 个编码的硬冲突候选源规则对,并将它们实现为 1,402 个具体见证人。在纯政策评估中,这些见证人进行了 13,335 次生成后试验,其中两个源规则均受管辖,并且两个合规标签均可判断。只有35.4%的人联合合规; 64.6% 违反至少一项受管源规则。这些配置文件是对 WIRE 选择的候选者的条件诊断,而不是部署频率或因果过量故障估计,但它们揭示了不同的策略、模型和工具操作解决模式。

使用见证的解决方案配置文件诊断 LLM 代理中的实时策略内指令冲突
图 1:诊断单个提示策略中的冲突的工作流程。规则从策略中提取,编码在 PyRule 中,成对比较,并用于构建具体的测试请求。主题模型回答这些请求,并根据它们遵循的规则来判断它们的输出。聚合判断可以识别在模型行为中产生实时冲突的规则对。