论文

表征曲率调节大语言模型的行为不确定性

Representational Curvature Modulates Behavioral Uncertainty in Large Language Models

模型评测模型行为与机制分析

摘要

在自回归大语言模型(LLM)中,时间拉直(temporal straightening)为下一词元预测目标如何塑造表征提供了一种解释。模型学会沿层逐渐拉直输入序列的表征轨迹,这可能通过线性外推促进下一词元预测。然而,这一轨迹与词元级行为之间的直接联系一直缺失。我们通过把上下文曲率——衡量表征轨迹在近期上下文中弯曲陡峭程度的几何量——与下一词元熵联系起来,提供了这样一个联系。在两个模型(GPT-2 XL与Pythia-2.8B)上,上下文曲率与熵相关,且这一关系在训练过程中显现。扰动实验揭示了选择性依赖:通过沿轨迹对齐的干预操纵曲率能可靠地调节熵,而几何上未对齐的扰动则没有效果。最后,在训练中把表征正则化得更直,能适度降低词元级熵而不损害验证损失。这些结果把轨迹曲率确定为一种影响LLM行为不确定性的、与任务对齐的表征特征。

表征曲率调节大语言模型的行为不确定性:论文配图
图 1:(A) LLM 架构示意图,重点关注每个转换器块之后的残余流中的令牌表示。 (B) 易于预测的句子(句子 1)与难以预测的句子(句子 2)的输入、内部表示和输出之间的假设关系。可预测的句子应具有更直的内部表示(较低的曲率)。因此,可能的下一个token的集合较小,这导致熵较低。相反,一个难以预测的句子预计会表现出更高的曲率并导致更高的熵。 (C) 用于预测标记熵的上下文曲率的公式。 (D) 跨层平均曲率变化与上下文曲率预测标记熵的相应变化之间的假设关系。