论文

评估 大语言模型 中的实用推理:来自标量多样性的证据

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

模型评测模型能力评测

摘要

评估 大语言模型 (LLM) 中的实用推理仍然具有挑战性,因为模型行为可能会因评估方法而异。先前的研究表明,基于提示的判断可能与模型的内部概率分布不同,从而引发了关于观察到的表现是否反映了潜在能力或任务引发的行为的问题。本研究使用标量多样性作为语用推理的分级诊断来研究这个问题。继 Hu 和 Levy(2023)之后,本研究比较了多个模型和实验设置的直接概率测量和元语言提示。结果表明,两种评估方法都没有始终优于另一种,而且不同模型系列、提示策略和任务结构的实用行为差异很大。此外,标量多样性梯度仅出现在特定的模型条件组合中,这表明 LLM 中的实用推理反映了内部概率表示和任务诱导的提示行为之间的相互作用,而不是单一评估范式捕获的稳定能力。这些发现强调了评估设计在解释 LLM 中的语用能力方面的核心作用。