论文
注意区分大小写
Attention is Case-Sensitive
摘要
在人类视觉感知中,大写字母作为一种自然的显着线索,可以在小写文本中吸引注意力。在本文中,我们提出了系统的实证表征研究,揭示了 大语言模型 (LLM) 表现出类似的特性:字母大小写调节内部注意力分配。通过对 13 个模型、9 个 LLM 和 4 个视觉语言模型 (VLM) 以及不同标记化方案的分析,我们表明,针对小写上下文以交替或大写形式格式化目标信息可将注意力集中在这些文本跨度上。在文本中,这种效应是普遍存在的,适用于所有评估的非推理模型。我们将其视为预训练 Transformer 先前未充分探索的潜在属性,而不是规定的方法。我们的研究揭示了一个中心注意力与绩效的分歧:虽然这种“外壳效应”会强有力地转移注意力,但它对下游准确性的影响却是不容忽视的,注意力的增加并不会本质上提高任务准确性,并且在交替情况等高熵环境中,可能会降低任务准确性。我们进一步确定了一个边界条件:推理模型中的深思熟虑的“思考”阶段充当语义缓冲区,减轻文本中的排版敏感性。将研究扩展到 VLM,我们发现效果部分转移:相同的提示侧外壳沿着两个耦合轴重新组织跨模式注意力,主要是从图像到文本提示的宏观脱离,其次是剩余视觉注意力集中在目标区域。通过将大小写隔离为不需要模型访问或 微调 的注意力转向的零样本机制,我们为预训练如何内化印刷重点提供了新的基础理解。