论文

LLM 基于属性的激活指导,用于生成特定组的解释

Attribute-Based Activation Steering of LLMs for Group-Specific Explanation Generation

模型推理推理策略与问题分解

摘要

为了有效地使人们理解新主题,解释应该适合他们的背景和能力。事实证明,仅靠提示不足以创建这样的解释,并且迄今为止还缺少其他计算方法。因此,本文研究了是否可以引导 LLM 生成针对特定人群的解释。为此,我们提出了一种方法,首先根据特定目标群体的解释风格和知识来识别特定群体的属性。然后,它以激活工程为基础,计算基于属性的转向向量,并在推理过程中将它们添加到 LLM 的内部激活中,以实现细粒度的转向。在我们的实验中,我们根据生成的解释的特异性和真实性来评估指导有效性。此外,我们还与来自不同目标群体的人类专家一起评估了一项研究中的解释。与提示和最先进的指导基线相比,我们的方法可以更好地针对目标群体定制解释,同时保持最佳的特异性与事实性平衡。