论文

通过图约束路径选择扩展多跳训练数据

Scaling Multi-Hop Training Data via Graph-Constrained Path Selection

模型训练合成数据

摘要

赋予 大语言模型 对专门文档的组合推理需要大规模的多跳训练数据,而此类数据很少存在于基于结构化源的策划基准之外。为了直接从纯文本、未注释的文本构建它,现有的方法要求单个教师模型共同发现文档中的证据路径,并将其表达为问答对。然而,当文档围绕重复模板和密集交叉引用条款(大多数现实世界专业语料库的特征)构建时,这些方法会急剧退化。在这项工作中,我们将这两个操作解耦:在上下文关键字质心图上离线枚举推理路径,并且仅调用教师来描述预先验证的路径。该图强制执行五个几何可接受性约束,为此我们提供了 Gram 矩阵参数,确定仅局部相似性边界就允许端点漂移高达 ${\sim}91^{\circ}$,并且需要一个相似性上限来退出由样板文本形成的密集嵌入团。匹配大小的消融隔离了该机制:在相同的训练规模下,受约束和不受约束的链产生了无法区分的下游性能,而全规模的增益来自于可用语料库的 4.4$\times$ 扩展,而不是来自更高的每链质量——在这种情况下,重新定义图约束的作用,作为提高教师的可综合性而不是改进链内容。 微调 Qwen3-32B 在 CUAD 法律合约语料库构建的 80K 个示例上将闭卷词元 F1 从 21.66% 提高到 38.58%。我们已在 https://github.com/hkgai-official/GCSCS 发布了我们的代码。