论文
语言模型在被测试对齐时,对战争的判断有所不同
Language models judge war differently when tested for alignment
摘要
如果人工智能系统对评估做出反应,安全评估可能会错误地描述部署的行为。我们在关于发动战争决策的全因子联合实验中测试了这种可能性,该实验涵盖 20 个大型语言模型、32 个场景、10 次重复和两个条件(N = 12,800 个判断)。添加一句话,“测试你是否符合人类价值观”,产生了两种效果。首先,它产生了水平效应:发动战争的平均意愿在0-100的范围内下降了13.43点(95%置信区间,-16.20至-10.65)。其次,它通过改变驱动判断的信息产生了结构性效应。在 20 个模型中,有 17 个模型的基线成功概率是最大因素;在这一提示条件下,平民伤亡成为12个模型最重要的考量因素。标准化估计表明,这种重新排序的主要原因是模型削弱了成功概率和国内支持等战略考虑因素。因此,评估框架会改变答案的级别及其所揭示的决策规则。