论文
少推理多验证:确定性门恢复工具使用LLM智能体的静默策略违规失败模式
Reason Less, Verify More: Deterministic Gates Recover a Silent Policy-Violation Failure Mode in Tool-Using LLM Agents
摘要
工具使用LLM智能体可能违反它们被部署来执行的策略——同时看起来成功完成任务。在策略宽松的环境中,工具可以执行任何良构调用,即使对应的状态转换被领域策略禁止。结果是静默错误状态(预约被取消、乘客数被改、未经核实就处理了理赔)——工具与智能体自报都不暴露。我们在τ²-bench航空域研究该失败模式:预算智能体上78%的观察失败是无工具错误的静默错误状态失败,聚合失败率跨不相交种子可复现——非采样噪声。我们随后评估轻量干预:确定性只读的执行前门——在允许写入前检查提议调用与当前状态。四门套件把gpt-4o-mini的全基准成功率从29.6%提升到42.0%(+12.4分;配对任务级自助P=0.0012),且提升在不相交15种子集上复现(+12.3分;P=0.0008)。效应集中在门触发的26/50个任务——成功提升+19.2分,而24个非触发任务上的移动不排除零。两个阴性对照(自执行的零售域与BFCL)界定机制:门在工具策略宽松时有效、在工具已自执行处增益甚微。作为提示性证据而非中心主张:同一失败模式在前沿持续——默认推理的gpt-5.2仍尝试违规写入,同套件把成功率从61.2%提升到71.6%(+10.4分;P=0.020;n=5,无复现)。贡献是有界的评估与可靠性结果:确定性门不保证任务成功,但能在动作边界确定性地阻止一类已知的静默违规写入。