应变一致性:编码智能体 执行轨迹中的故障前信号
Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories
摘要
基于 LLM 的 编码智能体 有时会在自己的推理中承认存在问题,然后继续进行。我们将这种模式称为紧张一致性:一种与安全相关的故障模式,其中代理拥有应该改变其行为的信息,声明该信息,但仍然对其采取行动。该模式与语言化的 奖励作弊 重叠,其中代理指定了任务代理与潜在目标之间的紧张关系,但无论如何都优化了代理。我们给出一个操作定义,构建一个 Claude Sonnet 4.6 判断器,读取模式出现的完整轨迹和标志跨度,并使用 Qwen3.5-35B-A3B 主干在 44 个 Terminal-bench-2 轨迹上对其进行评估。标记轨迹的失败率为 94%,而未标记轨迹的失败率为 46%(差距为 47 点,Fisher 精确 p = 0.003;排除三个提示嵌入示例后为 46 点,p = 0.006)。在匹配的选择性下,检测器的精度达到 94%,而词汇话语标记基线的精度为 88%;两种方法的 10 条轨迹交集的失败率为 100%(Clopper-Pearson 95% CI [69%, 100%])。我们在 Gemma4-31B 上复制了 43 条轨迹:总体信号方向一致,但不显着(20 点差距,p = 0.31),衰减主要由 13 条具有零思考内容的轨迹驱动,其中检测器没有要分析的底物。在高冗长的 Gemma 三分位数中,差距为 +30 分;在中、高冗长的 Qwen 三分位中,每个分值为 +40 分。第一个标志出现在两个模型的已用轨迹时间的中位数 83-84% 处,并且二进制标志在软化明确冲突标记(8/8 轨迹)的释义中幸存下来。与单变量预测器不同,检测器发出可解释的跨度输出(引用的确认、引用的操作和键入的冲突),显示代理看到和忽略的内容。