论文

随机采样在认识论上浅薄:温度变化与模型多样性在LLM中的维度鸿沟

Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

当语言模型在重复运行中给出不同答案时,这种变化是否揭示它不知道什么?自一致性经多数投票把该变化转为逐题不确定性估计。但同样的变化是否揭示跨题结构——相关题目一起翻转,像多样的集成那样?我们在相同问题上比较两种regime:一个模型在τ=1下跑100次,对24个LLM各自在τ=0下跑一次的集成。Marchenko–Pastur随机矩阵检验在两侧区分信号与采样噪声。在任何单一模型内,跨五个家族与三个基准(MMLU、HellaSwag、GSM8K),至多一个维度升到噪声之上;而跨集成,四个特征值越过噪声边缘,配对难度的伯努利零假设在500次蒙特卡洛抽取中至多产生一个。自一致性给出准确的逐题不确定性,却没有可检测的跨题结构;只有一个多样的集成才揭示模型不知道什么。

随机采样在认识论上浅薄:温度变化与模型多样性在LLM中的维度鸿沟:论文配图
图 1:维度差距。 (a) 边界 MMLU 问题的正确性相关矩阵的特征值谱 (Qwen2.5-7B, K=100K\!=\!100, Nb=121N_{b}\!=\!121)。没有特征值超过 MP 噪声边缘 λ+=4.41\lambda_{+}=4.41(红色虚线)。 (b) 相同度量比较:对于三个任务中的五个系列中的每一个,MP 信号计数≤1\leq\!1,但对于 2424 模型集成 (τ=0\tau\!=\!0) 为 44,与 500500 个匹配难度独立伯努利零抽签中的任何一个都无法匹配。 (c) Qwen2.5-7B 上的分半 pip_{i} (r=0.994r=0.994):连续样本是从固定的每个问题伯努利中独立抽取的。