论文

从参数到答案:大语言模型如何检索和使用他们的内部知识

From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge

模型评测模型行为与机制分析

摘要

当语言模型回答问题时,它对查询路由信息和目标知识的依赖性如何变化?我们通过对问题末尾的隐藏状态进行分层干预来研究这个问题。在 Qwen、Llama 和 Gemma 中,我们将国家/地区问题与名词、形容词和代码答案进行比较,同时保持几个不同的拟合测量值。成对条件请求方向描述了在自然单一国家问题中查询哪个国家;全球请求方向以配对问题描述第一国与第二国的请求;单独的选择候选者测试对隐藏状态下已经可用的内容的控制。对冻结的 Qwen 自然问题状态的诊断性重新分析表明,在对它的干预开始改变后来的拟合知识之前,成对条件方向会变得更强,随着这个因果窗口打开,而答案支持内容仍在形成。配对的三模型轨迹并不统一:Gemma 显示了部分重叠的中间层路由内容配置文件,而 Llama 在相同的门下没有持续的路由效果窗口。在配对协议中,对全局请求方向的依赖性从固定的较早层集到较晚层集减少,而对拟合内容的依赖性仍然存在。匹配的 Qwen 比较表明,成对条件方向保留了后期效应,因此这种操作切换涉及全局拟合方向而不是所有请求信息。这些结果将早期的可读性、自然强度、因果转向和后期的内容依赖性分开。