论文
论经验驱动的自我进化智能体的安全风险
On Safety Risks in Experience-Driven Self-Evolving Agents
摘要
经验驱动的自我进化已成为提高 大语言模型 智能体自主性的有前途的范例,但其对自我管理经验的依赖引入了尚未充分探索的安全风险。在这项研究中,我们研究了自我进化代理的经验积累和利用如何影响基于网络和实体环境的安全性能。值得注意的是,仅从良性任务中收集的经验仍然会损害高风险场景中的安全性。进一步的分析将这种退化归因于积累经验的执行导向性质,这强化了Agent采取行动而不是拒绝的倾向。在更现实的环境中,智能体同时遇到良性和有害的任务,与拒绝相关的经验会减轻安全性下降,但会导致过度拒绝,揭示了基本的安全性与效用的权衡。总的来说,我们的研究结果暴露了当前自我进化代理的固有局限性,并呼吁采取更有原则的策略来确保安全可靠的适应。