论文

您的 LLM 什么时候可以转向?

When is Your LLM Steerable?

模型评测模型行为与机制分析

摘要

激活引导提供了一种轻量级的方法来控制语言模型在推理时的行为,但它的成功或失败在很大程度上取决于提示、概念、模型和引导配置。找到成功转向的机制和边界通常需要昂贵的网格搜索和对完全自回归采样轨迹的事后评估。在这项工作中,我们研究是否可以在生成过程开始时(例如,在生成前几个词元之后)从模型的内部状态预测可操纵性,以及如何利用这样的预测器来提高操纵成功率。为此,我们首先引入 ASTEER,这是一个包含 1.4M 代转向的测试平台,涵盖 150 个概念,并标记了每个转向成功/失败。利用这个测试平台,我们通过提取比较跨层转向前后隐藏状态和初始解码步骤的特征来分析模型的早期解码动态。这些特征帮助我们了解转向效果如何沿着层和词元位置传播,这为可转向性预测提供了关键信息。然后,我们根据这些特征训练梯度提升决策树 (GBDT) 分类器,以预测干预是否会转向不足、成功或过度转向,而无需完整生成轨迹。我们的预测器在未见过的概念上获得了大约 0.7 的宏观 F1 分数,这表明早期隐藏状态编码了有关最终转向功效的大量结构化信息。我们进一步利用这种转向预测器作为转向强度搜索的指导,以很小的解码成本实现接近最优的性能。