论文

StudyBench:自我演化能否从教科书中提炼奥赛能力?

StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?

模型评测基准与评测资源

摘要

人类只需要学习少量写得好的教科书就可以掌握一门学科并尝试其最难的问题。我们认为,理想的自我进化方法应该具有相同的属性,即从原始训练材料中自主学习以获取可转移的问题解决能力。然而,我们仍然缺乏对其的直接测量。我们引入了 StudyBench,这是一种受控物理基准,可直接测量自我进化方法将训练材料转化为能力的效率。我们将测试集组织成应用集(Application Set)和转移集(Transfer Set),其中应用集由教科书上的疑难问题和评估吸收能力组成,转移集由奥林匹克级别的问题和评估转移能力组成。对三个基本模型中代表性的自进化方法进行基准测试,我们发现应用集的改进很少转化为更难的转移集。指导消融暴露了指导差距:即使是最强大的方法,也只能弥补相同材料作为上下文指导提供的一小部分内容。此外,每种方法都会遇到计算高原,在耗尽其计算预算之前就已经饱和。因此,剩下的差距是方法问题,而不是数据或计算问题。通过提供干净且受控的基准,StudyBench 将自我进化进程从开放式追求转变为未来研究的可衡量目标。我们的代码发布在 https://github.com/thunlp/StudyBench。

StudyBench:自我演化能否从教科书中提炼奥赛能力?:论文配图
图1 研究区建设管道。教科书被摘录为Corpus、“无答”指令和“无答”指令,它们共同构成培训材料;奥林匹亚问题则在单行的、仅测试的流中提取。在 Quen3-8B 上运行的能力过滤器使模型无法可靠地解答的项目; Llama-3.2-3B- Instruct 和 Opus 4.7 重复使用相同的项目。失败的教科书问题成为应用程序集; 失败的奥林匹亚问题通过一个附加的 Naive 可达性过滤器, 并成为传输集 。