论文
TCS-BENCH:最先进的生成式人工智能理论计算机科学研究能力的基准测试
TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability
摘要
我们介绍 TCS-Bench,这是用于评估 大语言模型 (LLM) 研究级理论计算机科学 (TCS) 证明生成的基准。 TCS-Bench 包含在顶级理论计算机科学场所(STOC、FOCS 和 SODA)发表的论文中的定理证明任务。每个任务都提供必要的上下文来导出目标结果的独立证明。我们在此基准上评估最先进的模型。我们通过验证代理验证生成的证明的正确性,并进一步根据一组目标语句和生成的证明对的人类专家证明判断对验证者进行基准测试。我们的参考验证器在专家标记集上的准确率超过 90%。