论文
通过代码依赖性进行基于结构的知识检索以进行多步数据推理
Structure-Grounded Knowledge Retrieval via Code Dependencies for Multi-Step Data Reasoning
摘要
使用 大语言模型 (LLM) 解决特定领域的数据分析任务时,选择正确的知识至关重要。然而,大多数检索增强方法主要依赖于词汇或嵌入相似性,这通常不足以代表多步推理所需的关键任务知识。在许多此类任务中,相关知识不仅仅在文本上与查询相关,而是基于可执行代码和执行计算的依赖结构。为了解决这种不匹配问题,我们提出了 SGKR(基于结构的知识检索),这是一种检索框架,它通过函数调用依赖关系生成的图来组织领域知识。给定一个问题,SGKR 提取语义输入和输出标签,识别连接它们的依赖路径,并构建与任务相关的子图。然后将相关知识和相应的函数实现组装为结构化上下文,用于基于 LLM 的代码生成。多步数据分析基准实验表明,对于普通 LLM 和 编码智能体,SGKR 始终比无检索和基于相似性的检索基线提高了解决方案的正确性。