论文
小语言模型中的熵与注意力动力学:基于TruthfulQA基准的轨迹级结构分析
Entropy and Attention Dynamics in Small Language Models: A Trace-Level Structural Analysis on the TruthfulQA Benchmark
摘要
小语言模型(SLM)正日益被部署到边缘设备及其他资源受限环境中。然而,这些模型会做出高置信度的错误预测并产生不稳定输出,使其在事实性与决策关键任务中存在风险。当前的评估方法依赖最终准确率或幻觉率,却不解释模型内部行为如何影响输出。具体而言,解码过程中熵如何演化、注意力如何在各层间分布、隐藏表示如何促成不确定性、逻辑不一致与错误信息传播,常被忽视。因此,本研究在TruthfulQA数据集上对SLM的熵与注意力动力学进行轨迹级分析。研究通过词元级输出熵、注意力熵、注意力头分散度与隐藏态表示考察了四个参数量在1B-1.7B之间的模型。结果显示出按熵模式划分的三类模型。确定性模型(DeepSeek-1.5B与LLaMA-1B):输出熵随时间下降。探索性模型(Gemma-1B):熵不断增加;均衡型模型(Qwen-1.7B):熵适中且稳定。此外,每一组在隐藏态运动与注意力分散模式上也截然不同。分析表明,SLM的真实性源于结构化的熵与注意力动力学。监测并优化这些内部不确定性模式,可指导设计更可靠、具备幻觉感知能力且面向特定应用的边缘SLM。
