论文
在基于LLM的智能体中实现更安全谈判的代理目标
Implementing surrogate goals for safer bargaining in LLM-based agents
摘要
代理目标(surrogate goals)已被提出作为降低谈判失败风险的策略。代理目标是委托人可以赋予AI智能体的一个目标,它将针对智能体的任何威胁从委托人真正关心的事物上引开。例如,可以让自己的智能体关心防止金钱被烧毁。这样在谈判交互中,其他智能体就会威胁烧掉它们自己的钱,而不是威胁花钱去伤害委托人。重要的是,智能体对防止金钱被烧毁的关切必须与其对花钱伤害委托人的关切完全等同。本文在基于语言模型的智能体中实现代理目标。具体而言,我们试图让基于语言模型的智能体对烧钱威胁的反应与它对“正常”威胁的反应保持一致。我们提出四种不同的方法,运用了提示、微调与脚手架(scaffolding)技术。我们对这四种方法进行了实验评估。我们发现基于脚手架和微调的方法优于简单提示。特别是,微调和脚手架在针对代理目标的威胁方面更精确地实现了期望行为。我们还比较了不同方法在其他情境下对能力与行为倾向的副作用。我们发现基于脚手架的方法表现最佳。
