论文
研究语言引导:大语言模型 架构中形容词效果的分析
Investigating Linguistic Steering: An Analysis of Adjectival Effects Across Large Language Model Architectures
摘要
要实现对 大语言模型 (LLM) 的可靠控制,需要精确、可扩展地理解它们如何解释语言线索。我们引入了一个严格的框架,使用 Shapley 值来量化各个形容词对模型性能的影响,超越轶事启发法到原则归因。将此方法应用于 MMLU 基准上各种模型(包括 o3、gpt-4o-mini、phi-3、llama-3-70b 和 deepseek-r1)中的 100 个形容词,我们发现了 AI 对齐的几个关键发现。首先,我们发现一小部分形容词充当了异常强大的“杠杆”,但它们的效果并不普遍。跨模型分析揭示了一种“家族效应”:共享谱系的模型表现出相关的敏感性特征,而架构上不同的模型以基本上不相关的方式做出反应,挑战了一刀切的提示策略的概念。其次,集中的后续研究表明,这些强大的形容词的引导方向不是内在的,而是高度取决于它们在提示中的句法作用和位置。对于像 gpt-4o-mini 这样的较大模型,我们提供了第一个定量证据,证明了强大的非加性相互作用效应,其中形容词可以协同放大、拮抗抑制甚至逆转彼此的影响。相比之下,像 phi-3 这样的较小模型表现出更多的字面意义和更少的组合响应。这些结果表明,随着模型规模的扩大,它们对提示的解释变得更加复杂,但也更难以预测,这对稳健地引导模型行为提出了重大挑战,并强调了对组合和特定于模型的对齐技术的需求。