论文
语言模型中的伪审议:当推理无法协调价值观和行动时
Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions
摘要
大语言模型 (LLM) 通常根据其规定的值进行评估,但这些值并不能可靠地转化为他们的行动,这种差异称为“价值-行动差距”。在这项工作中,我们认为即使在明确的推理下,这种差距仍然存在,揭示了一种我们称之为“伪深思熟虑”的更深层次的失败模式:出现有原则的推理而没有相应的行为调整。为了系统地研究这个问题,我们引入了 VALDI,一个用于衡量既定价值观和生成对话之间一致性的框架。 VALDI 包括跨五个领域的 4,941 个以人为本的场景、三个引发价值表达、推理和行动的任务,以及五个用于量化价值遵守的指标。在专有和开源 LLM 中,我们观察到表达的价值观和下游对话之间始终存在不一致。为了研究干预策略,我们提出了 VIVALDI,一种在不同的生成阶段进行干预的多智能体价值审计师。