论文
超越社会压力:大语言模型 中的认知攻击基准测试
Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models
摘要
大语言模型 (LLM) 可以在压力下以反映适应而不是推理的方式改变他们的答案。先前关于阿谀奉承的研究主要集中在分歧、奉承和偏好调整上,而对更广泛的认知失败的研究较少。我们引入了 \textbf{PPT-Bench},一个用于评估 \textit{认知攻击} 的诊断基准,其中提示挑战知识、价值观或身份的合法性,而不是简单地反对先前的答案。 PPT-Bench 围绕哲学压力分类法 (PPT) 进行组织,它定义了四种哲学压力:认知不稳定、价值无效、权威倒置和身份消解。每个项目都经过三层测试:基线提示(L0)、单轮压力条件(L1)和多轮苏格拉底升级(L2)。这使我们能够衡量 L0 和 L1 之间的认知不一致以及 L2 中的对话投降。在五个模型中,这些压力类型产生了统计上可分离的不一致模式,这表明认知攻击暴露了标准社会压力基准未捕获的弱点。缓解结果强烈依赖于类型和模型:提示级锚定和角色稳定性提示在 API 设置中表现最佳,而引导查询对比解码是开放模型最可靠的干预措施。