论文

信念轨迹能量:测量预测路径

Belief-Trajectory Energy: Measuring the Path to a Prediction

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 逐步修改其跨 Transformer 层的预测,但我们通常只观察最终输出,丢弃其形成的轨迹。我们引入了信念轨迹能量(BTE),这是一种基于模型的度量,它通过在模型中引起的分层预测修正来表征输入。通过将中间状态映射到共享预测空间,BTE 提供了信念变化的原则性度量,可以概括为标量或结构化深度剖面。理论上,我们表明局部 BTE 对应于 Fisher-Rao 几何下的预测修正,而修正序列捕获了超出初始到最终信念变化的信息。根据经验,标量 BTE 提供了跨不同推理任务的模型相关难度信号,而更丰富的 BTE 表示支持人类LLM评论检测和细粒度生成器归因,最高达到$0.998$ 宏 AUROC 和 $95.6\%$ 八向归因精度。进一步的分析表明,BTE 在整个预训练过程中不断发展,并由目标训练有选择地重塑,表明所得测量结果反映了评分模型所学到的内容。总之,我们的结果将信念轨迹确立为基于模型的原则信号,并提出了更广泛的视角,其中学习的模型本身可以作为表征其处理的数据的工具。更多演示请参见https://yingjiahao14.github.io/BTE-web/.

信念轨迹能量:测量预测路径的原论文方法或结果图
图 1:信念轨迹能量 (BTE) 概述。 BTE 量化由输入引起的分层预测修正,并将它们聚合成深度剖面。该配置文件可以进一步概括为无需训练数据难度测量的标量,并直接用于区分人类LLM评论和对生成器的属性响应。