智能体循环何时把停滞误当进展?长时自主LLM智能体循环中的自我评估偏差与外部锚定验证
When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops
摘要
长时程自主智能体在没有人工干预的情况下进行规划、行动并自行判断是否完成。当智能体给自己的工作打分时,自我评估偏差便会占据主导:看似合理的变化被当作进展接受,而现实世界的结果却在停滞或倒退。我们将这一失败模式命名为进展幻象(progress mirage),并通过受控测量表明,这是一个评估者以何为锚的问题。我们构建了一个测试台:固定智能体及其工具面,只操纵对循环进行把关的评估器的信息通道类型。一个原则上不可伪造的世界状态oracle由容器与网络隔离强制保障,并在每次运行时得到核验。在54个循环中,一个前沿智能体每次都宣称有改进,然而56%的循环实测增量小于或等于零。因此自我报告没有信息量,自评裁定门槛退化为来者不拒,使其曾达到的最佳部署状态劣化了19%。即便是最强的带内裁判——它能读完整的制品文本、变更diff以及自身的裁定历史——其接受的循环中44%是现实倒退,并拒绝了38%的真实改进;预注册的对抗性假设(强裁判能弥合差距)被否定。在一个成功规范可从制品本身验证的边界任务上,同一裁判的幻象降为零,差距收敛到注册阈值之内,表明差距取决于成功信号位于何处。一个只返回接受与否裁定的仅符号变体,使现实世界输出与完整反馈相当(110.0对113.0),说明收益来自把关机制的锚定方式而非反馈内容。对于成功信号存在于对话记录之外的开放式目标,仅仅扩大裁判规模并不够;具备现实世界访问能力的带外评估是结构性要求。