论文

代码作为表示:学术文档的可编译解析范式

Code as Representation: A Compilable Parsing Paradigm for Academic Documents

模型评测基准与评测资源

摘要

学术论文是科学知识的主要载体,但大部分知识仍然锁定在 PDF 中,这些 PDF 已针对人类阅读而不是机器使用进行了优化。对于多模态 大语言模型 (MLLM),核心挑战不仅是感知,而且是表示:科学页面将文本与结构化学术元素 (SAE) 交织在一起,例如表格、公式、图表和伪代码,其结构、数据和逻辑很难通过 Markdown 等常见替代品保存。因此,我们提出了可编译学术文档解析(CADP),这是一种将整个页面重建为上下文 \LaTeX{} 加上可执行 Python 的范式,以便可以重建、重新编译结构保留元素和可执行图表表示,并直接根据源页面进行验证。为了支持这种设置,我们引入了 CADP-Bench,这是一个经过专家验证的完整学术页面基准,包含紧密耦合的文本和多种 SAE 类型,并通过重新注入编译协议进行评估。我们使用 SOTA MLLM 和包含常见代理技术的探索性多代理基线进一步研究当前的功能。结果表明,即使是前沿模型仍然难以产生高保真可执行重建,这凸显了结构感知科学文档解析的巨大改进空间。 CADP-Bench 已发布用于未来研究。