论文

混合语言模型中的注意力回忆和递归控制

What Attention Recalls and Recurrence Controls in Hybrid Language Models

模型评测模型行为与机制分析

摘要

混合语言模型将注意力与固定大小的循环状态结合起来,但每个通道的作用仍不清楚。我们引入两种缓存级别的干预措施。分割预填充仅保留 KV 缓存或仅保留预填充上下文中的循环状态,然后生成答案。状态交换在一次前向传递中将一个上下文中的 KV 缓存与另一个上下文中的循环状态配对。在 Qwen3.5 和 Falcon-H1 上,两个通道按功能划分明显。精确检索只有通过注意力才能生存(完全准确率的 64-98%),并通过重复而崩溃到零。输出语言和角色反转了模式:两者都能够幸免于重复出现(70-80% 和 3-5 倍),而仅 KV 的语言准确性下降到约 1%。状态交换证实了这一点:答案从 KV 端获取其值,从循环端获取其语言。仅循环生成还接受从未在上下文中但与所见项目共享含义或部分的单词。注意力提供了对所说内容的查找;循环状态决定了模型接下来如何表达。