论文
ContractBench:LLM 代理可以保留观察合约吗?
ContractBench: Can LLM Agents Preserve Observation Contracts?
摘要
工具增强的 LLM 代理调用 API,其中间输出(例如预签名 URL、会话令牌和 OAuth 状态参数)是观察契约:其后续使用受到生成它们的外部系统限制的工件。我们表明,观察契约合规性(保留时间有效性和字节级完整性)是一种新兴的、易于回归的能力:它既不能由一般工具使用能力保证,也不能通过更大或更新的模型持续改进。为了衡量这一点,我们引入了 ContractBench,这是一个包含 33 个双轴任务的基准测试,它探测现有基准测试无法评估的两种正交故障模式:有效性故障(使用过期后的工件)和完整性故障(通过观察到操作管道损坏工件的字节)。我们的评估是确定性和程序化的,使用虚拟时钟控制时间和验证字节完整性的 SHA-256 哈希值。我们为每个结果分配一个来自现实世界 API 规范的失败标签。我们评估了 38 个模型并报告了四项发现:(i) 没有一个评估模型能够达到 80%,其中 Claude-Opus-4.6 领先,达到 77.8%,这表明当前的前沿模型仍然无法遵守观测合同; (ii) Qwen 3.5 中 4B (0%) 和 9B (56.6%) 之间的家庭内能力陡峭悬崖,在 397B-A17B 处平滑至 70.7%:悬崖上出现的是中间轨迹限制,而不是工具调用能力; (iii) GPT-5 系列的非单调缩放:代理 后训练 可以通过阿谀奉承驱动的回归来侵蚀合规性; (iv) 我们的失败分类法作为一种可操作的上下文奖励信号,在 42 个配对的 GPT-5.1 失败中产生 +7.1 pp。