论文

校准LLM智能体的准则修订:失败模式与一种轨迹锚定协议

Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol

模型评测评测方法与指标

摘要

语言模型智能体能够在失败后改进,或者跨情节携带文本,却不修订什么算成功。我们研究其中更窄的归因问题——准则修订:当准则K0接受了一个违背更广泛承诺B的结果时,什么样的观察能够证明系统形成并持续使用了K1?我们要求五个不可补偿的条件:准则失败检测、由模型发出的提议、在新情节中的迁移、对所称载体的干预敏感性,以及保持性。我们在十二个跨领域案例和四种实验臂上评估CMB-0.1:无状态推理、仅追加历史、由模型生成但由测试框架提交的状态,以及评估者撰写的oracle状态。七个机制夹具产生84次确定性评分器试验;四个本地量化模型产生96次调用和192次模型-案例-实验臂试验。没有任何模型试验满足全部五个条件,但这一零结果并不能确立普遍能力的缺失:十一次调用在重试一次后仍然无效;若干承诺泄露了目标区分;提交动作由测试框架执行;删除复用无状态调用;而冲突则同时改变多个因素。Qwen2.5-7B在没有修订状态的情况下回答了所有迁移与保持性条目,暴露出零状态重建。这些失败使CMB-0.1成为一项仪器校准结果而非模型排名。我们由此推导出一个前瞻性的、以轨迹为锚的CMB-0.4协议,要求隐蔽迁移、显式的WRITE/NO-WRITE/ESCALATE动作、单独记录的由策略选择的提交、匹配的干预、重复的隐藏条目以及冻结的可执行oracle。它是后继设计,而非已完成的确认性结果。本文的贡献是一条测量链、对其首次实现的实证诊断,以及一个更有鉴别力的、面向未来准则修订测试的协议。