论文

带有语言和库控制激活方向的指导代码 LLM

Steering Code LLMs with Activation Directions for Language and Library Control

模型评测模型行为与机制分析

摘要

代码 LLM 通常在中性提示下默认为特定的编程语言和库。我们研究这些偏好是否被编码为激活空间中可以在推理时操纵的近似线性方向。使用均值差异方法,我们估计五个语言/库对的分层转向向量,并将它们添加到生成过程中的模型隐藏状态中。在三个开放权重代码 LLM 中,这些干预措施在中性提示下大大增加了目标生态系统的生成,并且即使提示明确要求相反的选择,通常仍然有效。指导力度因模型和目标而异,常见的生态系统比稀有的替代方案更容易诱导,而过于强烈的干预可能会降低产出质量。总的来说,我们的结果表明 LLM 中的代码风格偏好部分由激活空间中紧凑的、可操纵的结构表示。