论文

CombEval:评估大语言模型组合计数的框架

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

模型评测基准与评测资源

摘要

我们呈现CombEval——评估大语言模型组合计数的动态基准。CombEval把每个问题表示为关于实体、组合对象、对象依赖与约束的带类型Cofola规格——支持受控生成带精确求解器验证答案的自然语言计数问题。不同于静态集合——CombEval支持对象类型、实体规模、约束数量与推理深度的系统变化。我们在直接与代码增广设定下评估11个LLM——发现模型在有序对象、不可分辨元素、相对位置约束与嵌套对象依赖上仍然脆弱。错误分析进一步识别约束解释与计数原理上的失败。CombEval为研究LLM何时及为何在组合推理上失败提供诊断试验台。代码与生成的基准套件公开于 https://github.com/YuxuZhou-CN/combination-problem-generation。

CombEval:评估大语言模型组合计数的框架:论文配图
图 1:当前 Cofola 后端的 CombEval 生成框架概述。生成器对类型化对象 DAG 𝒫=⟨D,O,C⟩\mathcal{P}=\langle D,O,C\rangle 进行采样,附加兼容的约束,使用模板描述生成的形式规范,并使用 Cofola 求解器验证确切的答案。