论文
自愈式Harness:Agent自我修改的运行时监督
Self-Healing Harness for Runtime Oversight of Agent Self-Modification
摘要
LLM 智能体可以改变自己未来的行为,这引出一个基本的控制问题:哪些自我生成的修改应被允许留存。我们将其形式化为自我修改的准入控制。智能体可以提议修改其操作指令,而外部运行时门控控制修改的持久化。我们将该原则实现为模型无关的自愈脚手架,围绕未经修改的智能体运行 Detect、Notice、Heal、Validate 循环。智能体在外部工作区撰写候选行为规则,规则在评估期间获得临时执行权限,只有在对触发失败有实测改进、且在受保护案例上的退化不超过固定余量时,才获得跨回合的持久权限。回放在可用时提供匹配证据,前向试验提供较弱的回退,语料级守卫则对累积的活跃规则集进行复测。在横跨 AppWorld、Terminal-Bench 和 tau2-Bench 的 16 组匹配的基线与脚手架运行中,门控拒绝了 383 个由回放裁决的提议;其中 211 个(55%)在改善触发失败的同时使一个原本正常的案例退化。这表明局部有益的自我修改会频繁到足以实质影响门控决策地引入附带退化,为外部准入控制提供了直接的实证动机。在全部 16 组配对中,脚手架的任务完成分数更高(两组配对自助区间排除零),重复试验可靠性在 12 组中更高、4 组持平、无一更低。由于适配修改的是诱发策略的上下文而模型权重保持不变,被接纳的修改仍可检查、可回滚,并兼容闭源权重模型。
