论文
从表格到量化陈述:通过可执行验证评估 LLM 推理生成
From Tables to Quantified Statements: Evaluating LLM Inference Generation through Executable Verification
摘要
大语言模型可以从表格生成流畅的描述,但其输出在逻辑上可能仍然不受结构化数据的支持。我们引入了 STAT-TO-TEXT,这是一项受控任务,其中大语言模型使用“全部”、“一些”、“否”和“大多数”等量化结构从统计表中生成量化的自然语言推论。为了评估这些推论,我们使用 LLM 生成的 Python 检查器代码,该代码在执行时会根据表验证相应的真值条件。我们比较了跨模型系列和量表的四个开放权重大语言模型,评估了忠实性、逻辑准确性、表格覆盖率和多样性。我们的结果表明,模型规模和系列很重要,与较小的模型相比,最大的模型 (GPT-OSS-120B) 始终能够产生最忠实的推论,而不会牺牲更大的表覆盖范围和量词多样性。这些发现得到了人工注释的支持,这表明自动检查器与人类的判断紧密一致。