论文

LLM会经历内部多重对话吗?经人设透镜研究推理

Do LLMs Experience an Internal Polylogue? Investigating Reasoning through the Lens of Personas

模型评测模型行为与机制分析

摘要

最近的工作表明,大语言模型(LLM)将行为特征(“角色”)编码为激活空间中的线性方向,通常称为“角色向量”。先前的工作已使用诸如静态手柄之类的方向来进行行为转向。在此基础上,我们将它们视为动态信号:随着推理的展开,我们可以监控和干预的探针。我们使用术语“多对白”来表示生成过程中角色向量和隐藏激活之间的对齐时间序列。四个开放权重模型的实验表明,多语言特征可以与低维激活基线竞争地预测 MMLU-Pro 上的正确性,同时通过其相关的角色方向保持可解释性。他们还提出了具体的指导目标,即在响应的不同阶段调节哪些潜在方向。我们将其实例化为一个简单的段落条件干预,可以提高四个模型中三个模型的准确性,指出阶段感知潜在转向是推理时间控制的一个有希望的方向。总之,这将多语言定位为推理时间监控和干预的可解释工具。