论文

共享词汇任务表示解释 LLM 中的行为变异性

Shared Lexical Task Representations Explain Behavioral Variability In LLMs

模型评测模型行为与机制分析

摘要

关于 大语言模型 (LLM) 最常见的抱怨之一是它们的及时敏感性——也就是说,它们执行任务或提供问题正确答案的能力可能不可预测地取决于提出问题的方式。我们通过比较两种截然不同但常用的提示风格来研究这种变化:基于指令的提示(以自然语言描述任务)和基于示例的提示(提供上下文中的少量演示对来说明任务)。我们发现,尽管性能随提示的变化而变化很大,但该模型在任务的不同提示中采用了一些常见的底层机制。具体来说,我们识别了特定于任务的注意力头,其输出从字面上描述了任务——我们称之为词汇任务头——并表明这些头在提示风格之间共享并触发后续的答案生成。我们进一步发现,提示之间的行为差​​异可以通过这些头部被激活的程度来解释,并且失败至少有时是由于竞争性任务表示削弱了目标任务的信号。我们的结果共同呈现出一幅越来越清晰的图景,说明 LLM 的内部表示如何解释对用户和开发人员来说看似特殊的行为。