论文

TwinCheck:面向有状态工具Agent的证据支撑负孪生验证

TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents

智能体系统Agent 动作执行与治理

摘要

一个仅在局部看似合理的工具调用就可能让原本成功的Agent轨迹脱轨。仅有怀疑并不构成干预的正当理由,因为替换本身可能引入验证本想防止的那类失败。我们提出TwinCheck,一种推理时验证策略:仅当轨迹满足与轨迹局部失败假设绑定的证据条件时,才考虑替换。它构造一个以轨迹为依据的反事实备选——负孪生(negative twin)——且仅当该孪生通过结构检查、并且成对验证器在两种候选顺序下都偏好它时,才替换Agent的提案。在成对评测中,精确重放将Agent已解析的响应与动作固定到第一个被接受的替换为止,从而把干预效应与重采样分离。在159个具有完整精确重放对的多轮BFCL V4任务的主分析中,完整策略把GPT-5.6 Sol的任务成功率从45.3%提升到58.5%(95%任务自助法置信区间[8.2, 18.8]),且未观察到由成功转失败的退化。这些发现共同把执行边界修复重构为一种受约束的比较,使反事实动作本身成为验证的对象。

TwinCheck:面向有状态工具Agent的证据支撑负孪生验证:论文配图
图 1:抗衡式验证与保守切换。对于通过证据与结构检查的执行者-孪生体对,TwinCheck 以 A/B 两种顺序评估相同的候选方案;反转测试检验的是顺序敏感性,而非提供独立一票。绿色圆圈编码 0–4 的评分量表得分。仅当两个判断都偏向孪生体、将执行者的方案标记为致命而孪生体为非致命、且满足置信度与质量余量要求时,才执行孪生体;否则保留执行者的方案。执行者/孪生体标注仅为说明之用,验证器只会收到 A/B 标签。候选描述与分数为示意;任务索引已省略。