论文

大语言模型 中不一定存在不完美悖论:模型失败之前的基准测试失败

The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure

模型评测评测方法与指标

摘要

不完美悖论为组合语义分析提供了有用的测试。最近的工作构建了一个 NLI 基准和报告,该模型经常从渐进的描述中推断出已完成的目的事件,并将这种行为归因于目的论偏差。它进一步认为,促使干预会导致校准危机。我们重新审查基准和结论,发现它很大程度上受到概念和评估错误规范的影响。我们发现了三个概念性错误规范。特别是,Aspectual Reduction 会影响基准构建、分析、实验和结论。根据严格的 NLI 标准,76% 的 A 组实例并未明确排除高潮。在我们的母语注释中,38% 的 A 组示例和 29% 的 C 组示例被判断为允许替代解释。为了控制这些问题和词汇变化,我们构建了词汇匹配的最小对。在评估层面,我们将事件语义 NLI 制定为多步推理问题,并评估中间语义决策和最终预测。我们的结果表明,模型通常不肯定高潮,但仍然接受相应的简单过去假设,我们将这种模式称为充分性偏差。我们进一步表明,提示干预会产生标签之间的决策转变,而不会可靠地改善潜在的语义理解和推理。中间和预言引导的分析确定了两种额外的故障模式:成分方面分类中的错误和对表面相关答案的表面形式吸引力。我们在具有合适提示的 Qwen-7B、GPT-5.4 和 Qwen-72B 上进行的实验为方面分类的上下文敏感性提供了初步证据,并表明这些模型可以实现与人类注释者相当的性能。