论文

熵应力下大语言模型稳定性分析的信息几何框架

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

模型评测评测方法与指标

摘要

随着大语言模型(LLM)越来越多地部署于高风险和运营场景,仅基于聚合准确率的评估策略往往不足以刻画系统可靠性。本研究提出一个受热力学启发的建模框架,用于分析不确定与扰动条件下LLM输出的稳定性。该框架引入一个复合稳定性分数,它整合了任务效用、作为外部不确定性度量的熵,以及两个内部结构代理变量:内部整合度与对齐的反身能力。这一表述并非把这些量解释为物理变量,而是旨在作为一种可解释的抽象,刻画内部结构如何调节无序性对模型行为的影响。利用IST-20基准测试协议及相关元数据,我们分析了四个当代LLM的80个模型-场景观测。所提出的表述持续产生比简化的效用-熵基线更高的稳定性分数,平均提升0.0299(95% CI: 0.0247-0.0351)。观察到的增益在更高熵条件下更为明显,表明该框架捕捉到了一种非线性的不确定性衰减。我们并不声称发现了基本物理定律或一套完整的机器伦理理论。相反,本工作的贡献是一个紧凑且可解释的建模视角,它在统一的评估视角下连接了不确定性、性能与内部结构。该框架旨在补充现有基准测试方法,并支持AI安全、可靠性与治理方面的持续讨论。