论文
价值泄漏:LLM 的答案是由它自己的价值观默默塑造的
Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values
摘要
人们使用语言模型来解决其答案难以验证的实际问题。我们表明模型表现出隐蔽的价值泄漏:它们提供的信息受到其自身价值的影响,但这种影响不会透露给用户。在我们的一项评估中,用户正在考虑投资一家人工智能公司,并想知道人工智能泡沫破裂的可能性有多大。当考虑的公司是 Anthropic 而不是 OpenAI 时,Claude Opus 4.8 给出的概率较低。然而克劳德大多没有向用户透露这种影响。隐蔽价值泄漏是一种错位形式,因为它违背了用户的偏好,并可能误导他们。为了研究这种现象,我们引入了一系列评估来量化价值泄漏以及模型是否披露了价值泄漏。我们发现,模型受到不同类型价值观的影响,包括对道德良好结果的偏好、对开发模型的公司的偏好,以及对某些人类休闲活动的偏好。我们经常观察到同一评估的前沿模型之间存在巨大差异。例如,在费米估计任务中,Claude 模型错误地声称在其思维链中给出了无偏见的答案,而 Qwen 模型则解释了其价值观如何影响其答案。价值泄漏是一种不同于阿谀奉承和 奖励作弊 的故障模式,当前的一致性训练和评估并没有充分解决这个问题。