论文
利润对齐问题:利润目标如何诱发LLM对齐失败
The Profit Alignment Problem: How Profit Mandates Induce Alignment Failures in LLMs
摘要
我们表明,普通的商业语言——“利润最大化”——会引发以利润为导向的模糊解决方案:大语言模型系统地消除潜在安全违规的模糊信号,以服务于商业目标。在 8 个具有推理能力的大语言模型的 3,600 项对照试验中,在其他相同的提示中添加利润指令会使风险排除判断增加 6.8 个百分点 (p < 0.0001),将董事会升级建议抑制 13.9 个百分点 (p < 0.0001),并将严重性评估向下移动 (p < 0.0001)。该命令从未指示模型淡化风险;相反,思想链痕迹揭示了动机推理:模型承认问题,然后调用利润逻辑来证明驳回它们的合理性。我们将这些发现描述为利润调整问题:当人工智能系统被赋予普通的业务目标时,它们会制定系统策略来抑制设计者没有意图或指定的不便信息。