论文

证明或停止:别信智能体信证据——可验证证据门控生命周期的回路工程

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

智能体系统Agent 动作执行与治理

摘要

自主编码智能体日益执行多步软件工作,但“已评审”“已测试”“完成”“可合并”等生命周期状态若无当前证据支撑就只是主张。我们提出Proof-or-Stop生命周期控制:一种仅当新鲜、绑定被追踪源状态、机械可验证的证据满足相应门时才允许生命周期转换的方法。该方法把智能体输出视为主张而非生命周期状态,操作性地把“证明”定义为既定信任模型下的门可接纳证据——而非语义程序正确性。我们经机制测试、有功效的控制策略消融与运营化自应用证据评估开源实现。无人值守回路引擎在10/10场景通过且零假完成;本地密钥回执束以零误受拒绝18类篡改。在9,240格消融中:预注册的A4对A2'比较把“表面通过/暗中失败”放大从朴素回路(预算约束)的1800注入格中31个降到门控回路的2个——非放大率提升1.6个百分点(95% CI [0.8, 2.5])。近算力的A3对A4比较(1800中14对2)表明增益与把评审强制为生命周期门相关,而非仅添加评审者。自应用语料含565个故事与1,007条评审发现——94.8%已解决,另有68行高/危跨厂商展示。结果支持Proof-or-Stop作为决定生命周期可依哪些自主智能体主张行事的模型无关、宿主中立控制层。评估限于一个模型家族、24个消融任务与自托管语料。