论文

$π^2$:结构起源的推理数据提高了 大语言模型 的长上下文推理能力

$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models

模型训练合成数据

摘要

我们研究了一种从初始结构化数据中整理推理数据的管道,以改进 大语言模型 (LLM) 中的长上下文推理。我们的方法 $π^2$ 通过严格的 QA 管理构建高质量的推理数据:1)从维基百科中提取和扩展表格,2)从收集的表格和相关上下文中生成现实的多跳分析推理问题,其答案通过双路径代码执行自动确定和验证,3)将逐步结构化推理轨迹反向翻译为给定现实网络搜索上下文的 QA 对的解决方案。在 $π^2$ 上使用 \textsc{\small{gpt-oss-20b}} 和 \textsc{\small{Qwen3-4B-Instruct-2507}} 监督 微调 在四个长上下文推理基准和我们类似的 $π^2$-Bench 上产生了一致的改进,平均绝对精度分别提高了 +4.3% 和 +2.7%。值得注意的是,我们的数据集促进了 self-蒸馏,其中 \textsc{\small{gpt-oss-20b}} 甚至通过自己的推理轨迹将其平均性能提高了 +4.4%,这证明了 $π^2$ 的有用性。我们的代码、数据和模型都是开源的,网址为 https://github.com/vt-pi-squared/pi-squared。