论文
一个可解码性判据预测隐藏状态选择何时在大语言模型中胜过多数投票
A decodability criterion predicts when hidden-state selection beats majority voting in large language models
摘要
将大语言模型(LLM)为同一问题采样的多个答案合并为一个决策是一个测试时信息融合问题,通常用多数投票解决。投票在困难问题上不可靠,因为采样答案共享相关误差,错误答案可能胜出,且抽取更多样本反而会使决策更糟。通过读取模型隐藏状态中的正确性信号来选择候选答案是一个有希望的替代方案,但其准确率因模型和任务而异,且没有度量能指示它何时可信。本文提出CASE(Correctness-Axis Selection,正确性轴选择),一种动态选择组合器,它在答案词元的隐藏状态上训练线性门并选择得分最高的候选。其主要贡献是可解码性(decodability),一个无泄漏的度量,衡量门对某问题的正确候选项相对错误候选项的排序能力,它可预测隐藏状态选择何时会优于投票。常规探针看起来准确只是因为问题身份泄漏,在按问题分组的评估下这种泄漏会消失。在保留数据上,可解码性以Pearson相关r=0.75预测选择相对投票的准确率增益,决策阈值接近AUC=0.60。在通用与医疗LLM上,CASE在中等问题上比投票提升最多19分,在困难问题上提升16.8分。可解码性取决于模型必须回忆的对齐知识,而非其规模,其预测可迁移到未见过的科学领域,误差在3.8分以内。因此它提供了一个实用判据,可针对给定模型和任务预先测量,用于在学习型选择与多数投票之间做取舍。
