论文
LongCrafter:通过证据图引导指令合成实现多样化的长上下文理解
LongCrafter: Towards Diverse Long-Context Understanding via Evidence-Graph-Guided Instruction Synthesis
摘要
合成长上下文监督的 微调 (SFT) 数据是增强 大语言模型 (LLM) 长上下文理解的可扩展方法,但现有方法存在三个局限性:任务覆盖范围窄、指令难度不足以及缺乏 忠实性 监督。我们提出 \textbf{LongCrafter},一种结构化综合框架,它将分层任务分类法与基于证据的管道结合起来。该分类法将长上下文理解组织为局部/浅层和全局/深层级别,并产生 32 种细粒度任务类型,作为全局生成先验。在这种分类法的指导下,LongCrafter构建了与任务对齐的长上下文,将它们分解为明确的证据图,对跨段落依赖关系进行建模,并生成严格基于所定位的证据跨度的指令-响应对,确保可控的难度和忠实、可追踪的推理。在 LongCrafter 数据上微调的模型在 Qwen2.5-7B 和 LLaMA-3.1-8B 上优于所有 SFT 基线,甚至优于 LongBench、LongBench~v2 和 LooGLE 上的官方训练后模型,在高难度任务上收益最大。进一步的分析表明,LongCrafter 数据更加多样化,并且在不同难度级别上分布得更好,并且经过训练的模型无论位置如何都能稳健地定位证据,有效缓解“中间丢失”问题。