论文

LLM 条件反射中有效性与流畅性的权衡:系统研究

On The Effectiveness-Fluency Trade-Off In LLM Conditioning: A Systematic Study

模型评测模型行为与机制分析

摘要

控制 大语言模型 (LLM) 的输出是其可靠部署的核心挑战,但对所涉及的权衡的清晰理解仍然难以实现。目前的调节方法通常只关注注入或移除目标概念的有效性,而忽略了生成质量。我们系统地研究了注射和去除场景中的一系列调节方法。我们发现,高效的转向方法通常会以牺牲流畅性为代价来实现调节。此外,我们还发现了与训练范式的一个关键但之前被忽视的交互:激活引导方法在指令调整模型上的效果远不如在基础模型上有效。另一方面,简单的提示和全面的监督 微调 是概念注入的可行选择,但在概念删除方面效果不佳。最后,廉价计算的文本指标与昂贵的 LLM-as-judge 分数高度相关,并提供对调节方法行为的见解。