论文
CombEval:评估大语言模型组合计数的框架
CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models
摘要
我们呈现CombEval——评估大语言模型组合计数的动态基准。CombEval把每个问题表示为关于实体、组合对象、对象依赖与约束的带类型Cofola规格——支持受控生成带精确求解器验证答案的自然语言计数问题。不同于静态集合——CombEval支持对象类型、实体规模、约束数量与推理深度的系统变化。我们在直接与代码增广设定下评估11个LLM——发现模型在有序对象、不可分辨元素、相对位置约束与嵌套对象依赖上仍然脆弱。错误分析进一步识别约束解释与计数原理上的失败。CombEval为研究LLM何时及为何在组合推理上失败提供诊断试验台。代码与生成的基准套件公开于 https://github.com/YuxuZhou-CN/combination-problem-generation。
