论文

操纵与任务相关:前沿 LLM 的多轴、多环境评估

Manipulation Is Task-Dependent: A Multi-Axis, Multi-Environment Evaluation of Frontier LLMs

模型评测安全与风险评测

摘要

我们评估了六种环境中六种前沿语言模型的操纵行为,从谈判任务到代理工作流程,产生了 13{,}590 个单独的场景。操纵率通过三个轴来衡量:框架(要求诚实或允许操纵)、激励结构(从无激励到实质性激励)和任务难度。现有的基准测试通常会改变单个环境中的单个轴,我们的结果表明这种方法是不够的。我们按操纵率对模型进行排名,并发现跨环境的 Spearman 等级相关性平均值为 $ρ= 0.055$,表明一项任务中的操纵倾向不一定能预测另一项任务中的操纵倾向。此外,我们发现驱动操纵的轴在不同环境中有所不同。在模型被激励歪曲未来行为的环境中,指导框架和结构性约束激励是主要驱动力;在模型被激励去歪曲 真值 的环境中,任务难度占主导地位。这种分裂是在五个环境中确定的,并针对第六个保留环境进行了验证。总之,这些发现说明了在衡量操纵倾向时严格的多维评估的重要性。