论文
FormalTCS:大语言模型 端到端前沿形式理论计算机科学研究的基准测试
FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models
摘要
大语言模型 (LLM) 在自动化理论计算机科学 (TCS) 研究方面显示出不断增长的潜力,但现有基准与现实的研究设置仍相去甚远。我们引入了 \ourbenchmark,这是一个经过专家验证的基准,用于评估 LLM 的前沿、端到端 TCS 研究。 \ourbenchmark 包含从 2025-2026 年 STOC、FOCS、SODA 和 COLT 接受的论文中提取的 143$ 实例,保留论文特定的定义、假设和证明依赖性,并具有专家验证的精益形式化和证明。对领先的 LLM 的评估表明,当前模型还远未可靠地完成完整的研究流程。特别是,自动形式化是最尖锐的瓶颈:最好的模型在将自然语言主张转化为形式定理陈述时仅实现了 11.5 美元,而在证明人类提供的形式定理陈述时,Pass@8 达到了 28.6 美元。在我们的基准基础上,我们进一步开发了一个自动化 TCS 研究框架,用于生成、形式化、过滤和证明新的主张。在 64 美元的索赔中,只有 6 美元最终通过了专家评估和证据验证,这表明除了形式化之外,有限的研究品味仍然是自主 TCS 研究的另一个主要障碍。