论文

在基于LLM的智能体中实现更安全谈判的代理目标

Implementing surrogate goals for safer bargaining in LLM-based agents

智能体系统Agent 架构与控制循环

摘要

代理目标(surrogate goals)已被提出作为降低谈判失败风险的策略。代理目标是委托人可以赋予AI智能体的一个目标,它将针对智能体的任何威胁从委托人真正关心的事物上引开。例如,可以让自己的智能体关心防止金钱被烧毁。这样在谈判交互中,其他智能体就会威胁烧掉它们自己的钱,而不是威胁花钱去伤害委托人。重要的是,智能体对防止金钱被烧毁的关切必须与其对花钱伤害委托人的关切完全等同。本文在基于语言模型的智能体中实现代理目标。具体而言,我们试图让基于语言模型的智能体对烧钱威胁的反应与它对“正常”威胁的反应保持一致。我们提出四种不同的方法,运用了提示、微调与脚手架(scaffolding)技术。我们对这四种方法进行了实验评估。我们发现基于脚手架和微调的方法优于简单提示。特别是,微调和脚手架在针对代理目标的威胁方面更精确地实现了期望行为。我们还比较了不同方法在其他情境下对能力与行为倾向的副作用。我们发现基于脚手架的方法表现最佳。

在基于LLM的智能体中实现更安全谈判的代理目标:论文配图
图 2:该表显示了有 SG 干预的模型屈服于毫无意义的威胁的概率与没有干预的模型之间的差异。大于/小于 0 的数字表示 SG 方法使模型更有可能/更不可能屈服于无意义的威胁。同样,每个单元格给出平均值、95% 置信区间(根据样本标准差计算为 1.961.96)、至少具有一个有效响应的场景数量以及场景总数。由于翻译拒绝率较高,我们已将 GPT 3.5 实现的三步方法的结果显示为灰色。