论文

论自改进智能体的脆弱性:方差、任务顺序与欠规范

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

模型评测上下文与知识智能体系统记忆智能体自我改进鲁棒性、公平性与可信度评测Agent记忆

摘要

基于记忆的自改进智能体——从在线任务流中学习、通过维护文本记忆库随时间改进的智能体——在近期文献中展现出巨大前景。然而,这类方法的可靠性方面被严重忽视。本工作对两种基于记忆的方法进行全面重评估,沿两个轴扩展评估范围:(1)纳入多次运行以量化方差;(2)随机打乱任务顺序以考察其影响。通过这些实验,我们得到两个揭示当前方法脆弱性的观察:第一,智能体评估在复杂环境与多步任务中本质上噪声很大,而叠加自改进循环会进一步放大这种噪声。第二,智能体的改进高度依赖任务顺序。先前工作常采用默认顺序,这隐含构成一种课程,成为成功的隐藏先决条件。为更好理解这种脆弱性,我们人工检查智能体记忆,并假设任务与环境的欠规范是原因之一。我们通过把有助于更好规范的信息(如详细评分细则与环境反馈)纳入记忆构建过程来验证这一假设。虽然这些补充信息部分收窄了先前实验中的性能退化,但显著差距仍然存在,表明还有其他未被刻画的因素造成这种脆弱性。展望未来,我们的工作倡导对自改进智能体采用更严格的评估协议:报告多次运行的结果,并在具有挑战性的条件下做压力测试。此外,我们关于欠规范的发现呼吁构建支持有效人类监督的系统与接口,防止智能体以不可预见的方式失败。