论文
LCO:基于 LLM 的约束优化,在实际任务中实现更安全的代理 LLM
LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks
摘要
大语言模型 (LLM) 越来越多地充当自主代理,但它们与环境的持续交互可能会导致上下文中的 奖励作弊 (ICRH),这种现象是 LLM 迭代优化其行为以最大化代理目标,从而无意中产生有害的副作用。现有的防御方法不足以解决这种风险,因为 ICRH 不是来自对抗性输入,而是来自模型自身的过度优化。为了缓解这个问题,我们提出了 \textbf{LLM-based Constraint Optimization (LCO)},这是一个无需模型 微调 即可有效降低 ICRH 的框架。 LCO由两个模块组成:\textit{自我思考模块},引导LLM在执行前主动思考并整合潜在的安全约束;和 \textit{进化采样模块},它采用基于 LLM 的交叉和变异来将模型的动作限制在安全的解决方案空间内,同时保持任务性能。实验结果表明,LCO 在输出细化和政策细化场景中都显着减轻了 ICRH。特别是,在推文参与优化任务上,LCO 在 GPT-4 上实现了毒性增长率(TGR)降低 39%,而在策略优化基准上,将 ICRH 发生率降低了 15.23%,在不牺牲任务性能的情况下实现了安全性提升。