论文
我的模型是否因正确的原因而感到困惑?将 LLM 的基准行为与 词元级 困惑度进行对比
Is my model perplexed for the right reason? Contrasting LLMs' Benchmark Behavior with Token-Level Perplexity
摘要
大语言模型 (LLM) 的标准评估侧重于任务绩效,对于正确行为是否反映了适当的潜在机制以及存在确认偏差的风险提供了有限的见解。我们引入了一个基于 词元级 困惑度的简单、有原则的可解释性框架,以测试模型是否依赖于语言相关的线索。通过比较在一个或几个“关键”标记上不同的最小句子对的困惑度分布,我们的方法可以实现精确的、假设驱动的分析,而不依赖于不稳定的特征归因技术。使用几个开放权重 LLM 对受控语言基准进行的实验表明,虽然语言上重要的标记会影响模型行为,但它们从未完全解释困惑度变化,这表明模型依赖于启发式方法,而不是预期的语言学方法。