论文

LLM对齐中的困境与冲突可解吗?优先级图的视角

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

模型推理推理验证与自校正

摘要

随着大语言模型(LLM)变得更强大、更自主,它们在许多场景中日益面临冲突与困境。我们首先对这些多样的冲突进行总结和分类。然后,我们将LLM在不同选择之间的偏好建模为一个优先级图:指令与价值是节点,边表示由模型输出分布决定的、随情境变化的优先级。这一图结构揭示出,实现统一而稳定的LLM对齐非常困难,因为该图既非静态,在不同情境下也未必一致。此外,它还揭示了一个潜在脆弱性:优先级劫持(priority hacking),即攻击者可以构造欺骗性情境来操纵该图并绕过安全对齐。为应对这一问题,我们提出一种运行时验证机制,使LLM能够查询外部来源以确证其情境并抵御操纵。尽管这一方法增强了鲁棒性,我们也承认许多伦理与价值困境在哲学上不可还原,这对AI对齐的未来构成长期的开放性挑战。

LLM对齐中的困境与冲突可解吗?优先级图的视角:论文配图
图1:当前LLM应用与使用中的五类冲突类型,为优先级图视角分析对齐困境奠定基础。