论文
表征曲率调节大语言模型的行为不确定性
Representational Curvature Modulates Behavioral Uncertainty in Large Language Models
摘要
在自回归大语言模型(LLM)中,时间拉直(temporal straightening)为下一词元预测目标如何塑造表征提供了一种解释。模型学会沿层逐渐拉直输入序列的表征轨迹,这可能通过线性外推促进下一词元预测。然而,这一轨迹与词元级行为之间的直接联系一直缺失。我们通过把上下文曲率——衡量表征轨迹在近期上下文中弯曲陡峭程度的几何量——与下一词元熵联系起来,提供了这样一个联系。在两个模型(GPT-2 XL与Pythia-2.8B)上,上下文曲率与熵相关,且这一关系在训练过程中显现。扰动实验揭示了选择性依赖:通过沿轨迹对齐的干预操纵曲率能可靠地调节熵,而几何上未对齐的扰动则没有效果。最后,在训练中把表征正则化得更直,能适度降低词元级熵而不损害验证损失。这些结果把轨迹曲率确定为一种影响LLM行为不确定性的、与任务对齐的表征特征。
