论文

迈向健康演化:探索人机反馈在自演化智能体中的角色与机制

Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems

智能体系统Agent 动作执行与治理

摘要

自我进化代理通过不断的自我博弈和自我生成的学习信号来改进,但自主进化也会导致能力下降和安全漂移。尽管人类反馈已被证明对静态和训练后智能体有效,但其在自我进化系统中的作用仍未得到充分探索。我们通过类人监督和审查(ANCHOR)引入代理规范校正,这是一个基于大语言模型的框架,可以模拟人类监督并在自我进化的各个阶段提供反馈。通过 ANCHOR,我们评估了两个具有代表性的开源自我进化代理系统,涉及编码、数学推理和安全性。我们的结果表明,即使是有限的监督也能大大减轻安全退化,同时保持核心进化目标的稳定表现。进一步分析表明,对输出验证阶段的监督是最有效的干预措施,而增加监督频率会产生收益递减。这些发现为设计更稳定、可控和符合人类的自我进化智能体系统提供了经验证据和实践指导。

迈向健康演化:探索人机反馈在自演化智能体中的角色与机制:论文配图
图 1:我们的核心见解的说明:人机交互减轻了自我进化代理的错误进化,并引导自我进化过程朝着更稳定和一致的模型输出方向发展。