论文
价值归纳如何重塑 LLM 行为
How Value Induction Reshapes LLM Behaviour
摘要
会话型 大语言模型 经过语言后训练,可表达特定的行为特征(例如好奇心、开放性和同理心)以及价值观(例如乐于助人、无害和诚实)。这样做是为了提高实用性、确保安全并改善人们与模型交互的体验。然而,价值观是复杂且相互关联的——一个人的价值观可能会改变另一个人的行为。此外,引入某些值可能会通过几代人使用的语言使模型更容易上瘾或阿谀奉承,从而对用户产生潜在的有害影响。我们研究了价值归纳到模型中的这些和其他意想不到的影响。我们使用现有偏好数据集的精选价值子集来微调模型,测量价值归纳对其他价值表达、模型安全性、拟人化语言和各种 QA 基准的影响。我们发现(i)诱导价值观会导致其他相关的、有时是对比价值观的表达,(ii)诱导积极的价值观会增加安全性,(iii)所有价值观都会增加拟人化语言的使用,使模型更加有效和阿谀奉承。