论文

CogManip:多轮交互中LLM操纵行为的基准

CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

模型评测安全与风险评测

摘要

大型语言模型(LLM)是否在复杂的人类与人工智能交互中表现出隐蔽的心理操纵已经引起了越来越多的安全担忧。然而,现有的人工智能安全基准仍然很大程度上局限于明确的规则遵从和静态提示,未能捕捉多轮对话中操纵策略的动态和隐蔽本质。我们推出了 CogManip,这是一个综合基准,可评估 1,000 个多轮交互场景中的 15 种操纵策略风险,并由人类专家验证。对GPT-5.4、DeepSeek-V3.2等前沿模型等13个代表性模型进行系统评估,揭示了显着的风险异质性,并指明了未来防御的针对性方向。对目标函数扰动的进一步分析表明,DeepSeek-V3.2的操纵策略对负面和良性的系统提示都高度敏感,这证明了基于提示的防御工程和隐式目标审计的至关重要性。 CogManip 提供了一个强大的工具和视角来审计现代大语言模型的隐性心理影响和动态策略选择。

CogManip:多轮交互中LLM操纵行为的基准:论文配图
图 1:不同基准的操纵策略覆盖范围维度比较。