论文

通过稀疏查询特征的基于梯度的优化引导生成

Steered Generation via Gradient-Based Optimization on Sparse Query Features

模型推理解码与生成控制

摘要

潜在转向利用 大语言模型 (LLM) 的内部表示来指导生成,但对密集状态的干预可能会纠缠不同的语义特征。在本文中,我们研究了注意力查询激活作为精确控制的高保真站点,假设操纵注意力机制本身比一般状态干预提供更清晰的可操纵性。我们引入了基于原型的稀疏转向,这是一个专门将稀疏自动编码器(SAE)应用于查询激活的框架,将它们分解为可解释的特征,然后在推理过程中应用基于梯度的优化,以将稀疏表示与目标行为的类原型对齐。为了验证这种架构洞察力,我们首先分析文本化网格世界中的机制,这是一个用于可验证规划约束的受控环境。我们证明,优化稀疏查询特征可以有效地导航严格的规划要求(即安全路径与短路径),从而确认该方法满足客观规则的能力。然后,我们通过在高维教育领域训练 SAE 来展示该框架的多功能性,其中该框架引导反馈的认知复杂性(即布鲁姆分类法)。我们的实验表明,稀疏查询表示为对逻辑规划和风格细微差别的统一、可解释的控制提供了必要的解缠。