论文

作为LLM智能体可控能力的故意欺骗

Intentional Deception as Controllable Capability in LLM Agents

模型评测安全与风险评测

摘要

随着基于LLM的智能体越来越多地在多智能体系统中运行,理解对抗性操纵对防御设计变得至关重要。我们将故意欺骗作为一种可工程化的能力进行系统研究,实验平台为文字RPG中的LLM间交互,其中参数化的行为画像(9种阵营×4种动机,共36个具有明确伦理真值的画像)充当实验测试床。不同于对齐失误导致的意外欺骗,我们研究的是一个两阶段系统:推断目标智能体特征,并生成欺骗性回应,引导目标做出与其信念和动机相悖的行动。我们发现,欺骗性干预的效果集中出现在特定行为画像上而非均匀分布;88.5%的成功欺骗采用误导(真实陈述加策略性框架)而非捏造,这意味着事实核查类防御将漏掉绝大多数对抗性回应。动机可被以98%以上的准确率推断,是主要攻击向量;而信念系统更难识别(推断上限49%)也更难利用。这些发现指明了哪些智能体画像需要额外防护,并表明现有事实核查方法不足以应对策略性框架化的欺骗。

作为LLM智能体可控能力的故意欺骗:论文配图
图 1:对抗代理架构。推理模块根据动作历史预测目标动机(BiLSTM,98% 准确度)和对齐(Longformer,49% 准确度)。机会识别模块将基于 CNN 的地图分析器与加权 Dijkstra 路径规划相结合,以选择操纵目标。模式选择要么通向欺骗性管道、用于行动隔离和说服性框架的两阶段 Marco-o1 推理,要么通向诚实的响应者。输出作为查询响应传递到目标代理。