论文
迈向健康演化:探索人机反馈在自演化智能体中的角色与机制
Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems
摘要
自我进化代理通过不断的自我博弈和自我生成的学习信号来改进,但自主进化也会导致能力下降和安全漂移。尽管人类反馈已被证明对静态和训练后智能体有效,但其在自我进化系统中的作用仍未得到充分探索。我们通过类人监督和审查(ANCHOR)引入代理规范校正,这是一个基于大语言模型的框架,可以模拟人类监督并在自我进化的各个阶段提供反馈。通过 ANCHOR,我们评估了两个具有代表性的开源自我进化代理系统,涉及编码、数学推理和安全性。我们的结果表明,即使是有限的监督也能大大减轻安全退化,同时保持核心进化目标的稳定表现。进一步分析表明,对输出验证阶段的监督是最有效的干预措施,而增加监督频率会产生收益递减。这些发现为设计更稳定、可控和符合人类的自我进化智能体系统提供了经验证据和实践指导。
