论文
所显示的偏好可以澄清 LLM 的对齐和转向吗?
Can Revealed Preferences Clarify LLM Alignment and Steering?
摘要
LLM 越来越多地用于在不确定性下制定或支持高风险决策,其中一致性不仅取决于事实准确性,还取决于模型如何权衡不同结果之间的权衡。我们提出了一个经验管道,用于估计 LLM 观察到的选择优化的隐含偏好:我们得出模型对未知数的概率分布以及它为决策任务做出的选择,然后拟合离散选择模型以恢复最能合理化模型决策的成本函数。我们展示了这种揭示的偏好描述如何允许严格评估模型是否以一致的目标导向方式运行,它们是否可以用语言表达与其揭示的决策策略相匹配的目标描述,以及提示是否可以可靠地引导这些策略来实现用户指定的成本函数。我们将这种评估应用于四个医学诊断领域以及多个前沿和开源模型。我们发现,虽然许多模型具有一定程度的内部一致性,但它们在忠实报告或采用偏好以响应用户方向方面也存在显着弱点。