论文
采样中的迷失:通过单词覆盖率分数 (WCS) 评估 LLM 中的词汇可达性
Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
摘要
现代 大语言模型 (LLM) 尽管拥有大量潜在词汇,但经常因生成重复且同质的文本而受到批评。虽然之前的研究主要集中在模型知识和训练数据上,但我们研究了解码机制在抑制语言多样性方面的作用。我们引入了单词覆盖分数(WCS),该指标量化了标准采样过滤器(例如 Top-$p$、Top-$k$ 和 Min-$p$)对上下文适当的人类词汇进行数学修剪的程度。 WCS 不是评估静态知识,而是根据采样参数来衡量低频、高信息人类单词的词汇存活率。通过审核人类创作的语料库片段上的开放权重模型,我们确定了解码器无法访问哪些逻辑词汇选择,即使它们位于概率空间内。我们的结果提供了定量证据,表明行业标准采样默认值充当了无意的审查机制,将人类表达的独特纹理平滑为同质化的话语。 WCS 提供了一个严格的框架来优化文本连贯性和词汇丰富性之间的权衡,并为在生成模型中保留人类语言的多样性提供了诊断工具。