论文

FindStatBench:评估大语言模型组合代码合成的执行基准

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

模型评测AI 基础设施Sandbox基准与评测资源Agent Sandbox

摘要

我们提出FindStatBench,一个评估大语言模型组合代码合成的执行基准。基于FindStat构建:含24个集合的2,329个任务与552万隐藏实例,覆盖统计量合成(把对象映射为整数)与映射合成(把对象映射为对象)。每个任务给出数学描述与至多五个公开输入输出示例;模型必须产出一个Python solve函数——不允许检索、工具使用、执行反馈、投票或重排。提交以在留出组合对象上的精确沙箱执行评分。我们评估十一个系统:四个闭源生产模型与经同一推理服务商提供的七个开放权重模型。FindStatBench揭示三个主要模式。第一,最强的开源与闭源系统在实例准确率上收敛到1个百分点内;全系统的oracle与从中档模型做五路采样都只带来有限的任务准确率增益。第二,示例可能有害:若干经典双射在零示例下完美解决、却在五示例提示下失败。第三,部分失败反映输出预算机制:推理可能在代码发出前耗尽可见响应。总体上,统计量合成远易于映射合成;部分集合仍接近零;长提示造成陡峭的准确率悬崖;精确的符号规则归纳仍然脆弱。