论文
大语言模型作文任务中的因果和可解释结构
Causal and Interpretable Structures in LLM Compositional Tasks
摘要
大语言模型能够解决的任务,其答案不仅取决于单个输入标记,还取决于它们之间的关系。这些关系信息如何跨Transformer层表示和处理?我们研究提示集合的激活,需要推断与循环概念(月、小时、工作日和音符)相对应的三个标记之间的关系,以正确预测下一个标记。在模型系列(Llama、Qwen、Gemma 和 Mistral)和循环概念中,我们发现词元之间的联合依赖性如何以几何方式组织和因果使用的一致的分层进展:中间层使用基于两个词元之间推断关系的联合表示,而后面的层使用与所有三个词元关联的联合表示来正确完成任务。我们还发现了标记之间的其他关系,这些关系是几何结构的,但在下一个标记预测中保持因果惰性。至关重要的是,当综合起来时,这些几何和因果研究揭示了表示级别的机制,该机制逐步组织和组合关系信息以形成答案。更令人惊讶的是,将模型限制为这种因果相关的联合表示可以提高下一个标记的预测准确性。