论文

风格向量引导大语言模型的有效性:一项人类评估

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

模型评测模型能力评测

摘要

在推理时控制大语言模型(LLM)的行为,对于使输出与人类能力和安全要求对齐至关重要。激活引导通过直接修改内部激活来引导生成,为提示工程和微调提供了轻量替代。本研究在三个重要方向上推进文献。首先,虽然先前工作展示了使用自动分类器引导情感基调的技术可行性,本文呈现了关于LLM输出情感基调的激活引导的首项人类评估,通过Prolific从190名参与者(n=190)收集超过7000个众包评分。这些评分同时评估感知情感强度和整体文本质量。其次,我们发现人类与基于模型的质量评分高度一致(平均r=0.776,范围0.157-0.985),表明自动评分可以代理感知质量。中等引导强度(λ≈0.15)可靠地放大目标情感同时保持可理解性,对厌恶(ηp²=0.616)和恐惧(ηp²=0.540)效果最强,对惊讶(ηp²=0.042)效果最小。最后,从Alpaca升级到LlaMA-3带来了更一致的引导,在所有情感和强度上均显著有效(均p<0.001)。评分者间信度高(ICC=0.71-0.87),凸显了发现的稳健性。这些发现支持基于激活的控制作为跨情感维度引导LLM行为的可扩展方法。

风格向量引导大语言模型的有效性:一项人类评估
图1:目标风格激活提取示意:将目标风格的 N 个样本输入 LLM,并计算每一层 i 的平均激活,以表示该风格的特征激活模式。