论文

反例作为智能体自我纠正的反馈

Counterexamples as Feedback for Agent Self-Correction

智能体系统Agent任务评测

摘要

单轮代码生成指标低估了已部署代理的核心属性:它们是否可以在收到具体反馈后修复错误的工件。本文提出了 A-CEGIS,这是一个轻量级框架,它使用反例作为反馈来评估自然语言到正则表达式合成中的多轮细化。代理提出正则表达式,确定性预言机在完全匹配语义下检查它,紧凑的假阳性或假阴性见证人指导下一轮。在 30 个 NL-RX-Turk 任务中,诊断反例反馈在四轮消融预算内解决了 90% 的任务,相比之下,零样本生成为 17%,通用自校正为 27%,纯错误反馈为 23%。在带有强化的完整诊断运行中,所有任务都在最后一轮在隐藏集上得到解决,平均成功时间为 2.7 轮,在有针对性的探测后,成功率为 77%。这些结果表明,A-CEGIS 衡量智能体跨回合改进的效率,同时在原始保留案例之外添加实用的稳健性检查。