论文

大语言模型的信息几何是共享的、可学习的、可控的

The information geometry of large language models is shared, learned, and controllable

模型评测模型行为与机制分析

摘要

大语言模型 学习类似的行为,但仍不清楚它们共享什么结构或如何在不干扰他人的情况下改变一种行为。下一个词元概率的 Fisher-Rao 几何连接了这些问题:行为决定了该几何直到输出保持对称性,而激活几何取决于坐标。在 Transformer、状态空间和循环模型中,输出几何图形比激活几何图形更加一致,并且共享几何图形支持语义类别传输。与人类单词选择的一致性随着预测准确性、规模和训练的增加而增加,并且在仅模型校准后进一步提高。词元概率和读出几何结构共同预测频谱及其有效维度。受控语言分配表明几何遵循跨体系结构的语言定律。预训练语料库统计数据可以预测无需重新校准的事实获取,而随机实验表明,更深层次的证据大大延迟了每个测试架构和证据构建的获取。最后,几何学规定了最小干扰的局部干预,预测其相对成本,并支持可重复使用的控制:在捐赠者提示上学到的更新转移到看不见的提示,同时比欧几里德控制更好地保留参考提示上的行为。相同的几何校正改进了转向、编辑、归因、词典学习和 微调。