论文
从价值冲突探究LLM价值表达的结构与动态
Probing the Structure and Dynamics of LLM Value Expression through Value Conflicts
摘要
大语言模型 (LLM) 的伦理评估通常将模型值描述为静态和整体的。相比之下,我们认为 LLM 价值表达可以更好地理解为一种结构化但动态的现象。为了研究这一点,我们引入了冲突驱动的价值探测,这是一个受控框架,将 LLM 置于价值冲突中,并实施四种类型的干预措施来扰乱这些冲突以探测 LLM 价值表达。将此框架应用于十个 LLM,我们识别出三种重复出现的模式。 (1)表达二元性:模型从抽象评估中广泛的理想主义取向转向具体冲突中更务实的优先事项。 (2) 功能可操纵性:模型很容易根据任务定义的价值目标重新配置其表达的价值概况。 (3)有限的可塑性:这种重新配置并非没有限制,即压力导致以安全和目标为导向的优先级转变,而负面框架将受保护的价值与那些更容易改变方向的价值区分开来。总之,这些发现描述了 LLM 价值表达的结构和动态:上下文灵活地重新配置所表达的优先级,但在行为边界之内。该行为帐户为理解 LLM 中的可控性、一致性和安全性提供了基础。代码和数据可在 https://github.com/ZeroGen-Lab/CFProbe 获取。