论文

LLM 包含众多:部署上下文如何重塑模型级首选项和值

LLMs Contain Multitudes: How Deployment Context Reshapes Model-Level Preferences and Values

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 在最近的评估工作中越来越被认为具有稳定的模型级偏好和价值体系。然而,伴随的稳健性检查仅限于偶然的提示扰动,例如语法变化和选项重新排序。这使得测量的属性在周围任务上下文发生变化时是否仍然存在,就像在大多数实际部署中一样。我们直接通过两个已建立的成对范式对此进行测试:对国家偏好进行排名并引发效用判断。在这两种情况下,我们都会创建部署上下文——模型在做出具体的依赖于值的选择时执行的高级任务——我们的控制变量,在不同的框架中变化,例如撰写 Reddit 帖子或新闻文章。在五个 LLM 和超过 120 万个成对决策中,部署上下文产生的变化远远大于提示释义和温度控制。在超过 15 个国家/地区的国家/地区偏好排名中,背景因素导致了广泛的、统计上显着的排名变化;之前的研究中报告的全球北方偏袒总量本身就是与环境相关的,每个模型的偏见都会在不同环境中系统地变化。在超过 50 个结果的效用启发中,广泛的跨类别排序得以保留,但领域内的细粒度排名差异很大,并且结果之间的基本汇率(例如,一个地区的生命数量与另一个地区的人口数量相等)在中位数上变化了 2.47 倍。因此,报告的模型级首选项和实用程序可以更好地理解为上下文条件测量,而不是固定的模型级属性:在一个框架下获得的安全保证在另一个框架下提供有限的保证。