论文

MetaBench-Harness:用双循环搜索优化基准生成流程

MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses

模型评测基准与评测资源

摘要

大语言模型 (LLM) 的快速进步正在使静态基准测试的饱和速度快于其设计速度。虽然现有的自动进化框架试图通过扰乱单个任务来生成更难的问题,但它们仍然受到严格的、硬编码的生成规则的限制。超越孤立任务的演变,我们建议使用双循环搜索框架 MetaBench-Harness 端到端优化基准生成工作流程本身。具体来说,内部循环利用基准Harness在每一轮中生成新的基准,而外部元Harness编排层基于历史演化轨迹迭代地细化和搜索Harness实现。通过将 MetaBench-Harness 应用于竞争性编程 CodeContests 和奥林匹克数学 AIME-2024 数据集,我们证明了演进的基准对于前沿模型具有挑战性和区分性。轨迹和质量分析验证了 MetaBench-Harness 能够实现多维进化,在连续轮次中稳步提高进化合理性、基准能力和评估者鲁棒性。此外,案例研究揭示了它有效利用不同的难度杠杆来重新构建问题并提升所需的能力。最终,这项工作为基准饱和的紧迫挑战提供了解决方案。