论文
作为LLM智能体可控能力的故意欺骗
Intentional Deception as Controllable Capability in LLM Agents
摘要
随着基于LLM的智能体越来越多地在多智能体系统中运行,理解对抗性操纵对防御设计变得至关重要。我们将故意欺骗作为一种可工程化的能力进行系统研究,实验平台为文字RPG中的LLM间交互,其中参数化的行为画像(9种阵营×4种动机,共36个具有明确伦理真值的画像)充当实验测试床。不同于对齐失误导致的意外欺骗,我们研究的是一个两阶段系统:推断目标智能体特征,并生成欺骗性回应,引导目标做出与其信念和动机相悖的行动。我们发现,欺骗性干预的效果集中出现在特定行为画像上而非均匀分布;88.5%的成功欺骗采用误导(真实陈述加策略性框架)而非捏造,这意味着事实核查类防御将漏掉绝大多数对抗性回应。动机可被以98%以上的准确率推断,是主要攻击向量;而信念系统更难识别(推断上限49%)也更难利用。这些发现指明了哪些智能体画像需要额外防护,并表明现有事实核查方法不足以应对策略性框架化的欺骗。
