论文

面向大语言模型结构推理的视觉图脚手架

Visual Graph Scaffolds for Structural Reasoning in Large Language Models

模型推理推理策略与问题分解

摘要

图已被用来增强结构化推理的大型语言模型(LLM),主要是在测试时向模型提供外部知识源。在本文中,我们采取不同的观点:图对于大语言模型的价值不仅在于提供信息,还在于组织推理。受到人类如何使用图形结构思维导图来组织分支和聚合思想的启发,我们询问图形是否可以作为推理辅助的内部形式。我们在多跳问答任务中研究这个问题,其中教师提供的推理轨迹被重写为图形思维导图并用于指导学生模型。我们的实验揭示了明显的模态差距。当图形结构被扁平化为文本时,一旦直接答案提示被删除,它们的好处就会变得有限。在这种抽象指导设置下,推理效率和答案质量都会大幅下降。相比之下,视觉图引导在没有直接答案线索的情况下仍然有效,并且在监督微调和基于 KL 的蒸馏之后其优势仍然存在。上述发现支持这样的观点:图不仅应该作为大语言模型的外部知识结构来研究,而且还应该作为组织推理的视觉支架。

面向大语言模型结构推理的视觉图脚手架:论文配图
图 1:图引导推理框架概述。 (a) 教师推理和答案:强大的教师模型解决多跳问题并生成详细的推理轨迹。 (b) 指导生成:教师的推理被转化为四种类型的指导工件:文本与视觉模式,以及直接与抽象风格。 (c) 学生答案:学生模型利用生成的指导得出正确答案。 (d) 蒸馏:学生通过 SFT 或 KL 内化结构化推理。