论文
随机采样在认识论上浅薄:温度变化与模型多样性在LLM中的维度鸿沟
Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs
摘要
当语言模型在重复运行中给出不同答案时,这种变化是否揭示它不知道什么?自一致性经多数投票把该变化转为逐题不确定性估计。但同样的变化是否揭示跨题结构——相关题目一起翻转,像多样的集成那样?我们在相同问题上比较两种regime:一个模型在τ=1下跑100次,对24个LLM各自在τ=0下跑一次的集成。Marchenko–Pastur随机矩阵检验在两侧区分信号与采样噪声。在任何单一模型内,跨五个家族与三个基准(MMLU、HellaSwag、GSM8K),至多一个维度升到噪声之上;而跨集成,四个特征值越过噪声边缘,配对难度的伯努利零假设在500次蒙特卡洛抽取中至多产生一个。自一致性给出准确的逐题不确定性,却没有可检测的跨题结构;只有一个多样的集成才揭示模型不知道什么。
