论文
通过迭代零空间投影提取角色子空间进行调制
Extracting Persona Subspaces Through Iterative Nullspace Projection For Modulation
摘要
大语言模型 (LLM) 可以采用不同的角色来调整其语义、专业知识和视角,以适应不同的用户和任务。对这些特征的精确控制对于确保模型行为的安全性和可靠性至关重要。激活引导和基于提示的角色归纳等现有方法将角色减少到单一主导方向,错过了只有在主导信号被分解后才会出现的更精细的嵌套特征。我们引入调制作为一种设置,其中角色上下文已经嵌入到被操纵的内容中,需要控制方法来放大或抑制已经存在的特征,而不是从头开始注入它。 PaSS 是一种推理时控制范例,它将角色建模为模型潜空间中的多维子空间,而无需监督对比示例。角色子空间通过迭代概念擦除来提取,并应用于调节角色引导的生成而无需重新训练。为了提取这个子空间,我们使用迭代零空间投影(INLP)来线性和迭代地隔离特定角色的方向。我们针对 MATH-500、TinyAlpaca、GSM8K 和 IFEval 等不同任务对六个角色进行了因果评估,结果表明,有区别的迭代子空间提取可以捕获给定角色背后的不同特征,从而实现比单向附加方法更强、更大的调制,同时保持内容保真度。我们进一步研究每个子空间内的个体剥离方向,以揭示它们编码的角色行为的不同方面。总的来说,我们表明角色子空间提供了一个可控、可解释和可概括的框架,用于在不牺牲任务性能的情况下调节LLM行为。