论文

使用结构化思维链和微调 SLM 进行长文档 QA

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

摘要

大语言模型 (LLM) 广泛应用于文档数据分析,但对长且嘈杂的文档的直接推理仍然脆弱且容易出错。因此,我们研究文档问答 (QA),它将分散的证据整合为结构化输出(例如表格、图表或块),以支持可靠、可验证的 QA。我们提出了一个双支柱框架 LiteCoST,以通过小型语言模型 (SLM) 实现高精度和低延迟。支柱 1:结构化思维链 (CoST)。我们引入了 CoST 模板,这是一种模式感知指令,可指导强大的 LLM 生成逐步 CoST 跟踪和相应的结构化输出。该过程产生最小的结构,规范实体/单位,对齐记录,序列化输出,并验证/细化它,从而产生可审计的监督。支柱 2:SLM 微调。紧凑模型分两个阶段在 LLM 生成的 CoST 数据上进行训练:监督 微调 进行结构对齐,然后进行组相对策略优化 (GRPO),其中包含答案/格式质量和流程一致性的三重奖励。通过将结构优先行为提炼到 SLM 中,此方法使用 3B/7B SLM 在多域长文档 QA 上实现了与 LLM 相当的质量,同时延迟比 GPT-4o 和 DeepSeek-R1 (671B) 低 2-4 倍。代码可在 https://github.com/HKUSTDial/LiteCoST 获取。