论文

数学文本延续的可能性评分:带有快捷漏洞测试的自我监督基准

Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities

模型评测基准与评测资源

摘要

我们引入了一个自动生成的基准来预测技术论文中的隐藏文本。一篇论文提供了可见的上下文 $X$ 和隐藏的延续 $Y$;评估的模型写入辅助预测字符串 $Z$,并且单独的评分器将下一个标记概率分配给 $Y$,无论是否以 $Z$ 为条件。与 $Z$ 是最近上下文而不是预测的控件相比,这给出了 $Z$ 是否传输有关延续的信息的无标签测试。我们的主要测试平台是方程后缀预测:预测器查看上下文和显示方程的第一部分,然后预测其余部分。该任务将表面级 arXiv/TeX 文本建模与推理敏感推理相结合;后缀是许多大致等效的延续之一,因此基准是通过统计方式读取的,而不是逐项读取的。在最近 138 篇物理和数学论文的 1363 个方程延续中,GPT-5.5、Opus 4.7 和 GPT-5.4 nano 的预测都提高了 Qwen3-8B 和 Kimi K2.6 评分器下上下文控制的截断可能性,区分模型族和推理工作设置,无需人工标签。为了模拟 $Z$ 进一步启动评分器而不是做出有用预测的快捷方式,我们还根据仅上下文提示对评分器进行微调,并将其应用于保留的论文作为更强的控制。 GPT-5.5 预测仍然优于这一微调控制; GPT-5.4 nano 预测则不然。较长的散文/TeX 延续显示出积极但噪音较大的控制提升,集中在目标开头附近。这些结果支持将跨模型似然评分作为静态基准,并作为在应用强化学习或模型选择优化之前探测捷径漏洞的设置。