论文

框架问题:通过基于行为的价值调整来​​解决决策中的框架敏感性

Framing Matters: Addressing Framing Sensitivity in Decision-Making through Behaviorally-Grounded Value Alignment

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地部署在法律推理等高风险决策环境中,其中事实等效输入下的一致性至关重要。然而,我们发现事实保留但框架不同的输入可能会严重破坏 LLM 决策的稳定性。为了系统地研究这个问题,我们引入了 Fragile,这是一个大型基准,它将保留事实的语义框架隔离在三个受控维度上:价值着色的叙述、时间切片和叙述生动性。我们的实验表明,LLM 对框架的敏感性很高,平均决策翻转率为 28.6%。我们发现,简单的事先提示级和激活级干预不仅不能抑制框架敏感性,反而会积极放大它。因此,我们提出了 Valign,一种表示级方法,通过将决策锚定到稳定值先验,将隐藏状态转向模型的值一致方向,并从模型的隐藏状态投影出时间生动性敏感方向,从而显式地针对这些框架维度。 Valign 持续减少框架引发的决策翻转,表明稳健的缓解措施需要直接针对框架运作的内部路径。