论文
TwinCheck:面向有状态工具Agent的证据支撑负孪生验证
TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents
摘要
一个仅在局部看似合理的工具调用就可能让原本成功的Agent轨迹脱轨。仅有怀疑并不构成干预的正当理由,因为替换本身可能引入验证本想防止的那类失败。我们提出TwinCheck,一种推理时验证策略:仅当轨迹满足与轨迹局部失败假设绑定的证据条件时,才考虑替换。它构造一个以轨迹为依据的反事实备选——负孪生(negative twin)——且仅当该孪生通过结构检查、并且成对验证器在两种候选顺序下都偏好它时,才替换Agent的提案。在成对评测中,精确重放将Agent已解析的响应与动作固定到第一个被接受的替换为止,从而把干预效应与重采样分离。在159个具有完整精确重放对的多轮BFCL V4任务的主分析中,完整策略把GPT-5.6 Sol的任务成功率从45.3%提升到58.5%(95%任务自助法置信区间[8.2, 18.8]),且未观察到由成功转失败的退化。这些发现共同把执行边界修复重构为一种受约束的比较,使反事实动作本身成为验证的对象。
