论文

Corpus2Skill:将企业知识提炼成可用于 QA 和 RAG 的可导航代理技能

Corpus2Skill: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

摘要

检索增强生成 (RAG) 将 LLM 响应基于外部证据,但将该模型视为搜索结果的被动消费者,不了解语料库的组织方式或尚未看到的内容。我们提出了 Corpus2Skill,一种用于有界的、结构连贯的语料库(例如企业知识库)的系统级检索架构:离线编译器将语料库提炼成分层技能目录,并在服务时 LLM 代理对其进行导航,从鸟瞰图钻取到逐步更精细的摘要到文档,并在分支效率低下时回溯。在企业客户支持基准上,Corpus2Skill 以适度的成本权衡提高了单次密集、混合、分层检索和代理 RAG 基线的答案质量和基础,并且在编码器匹配控制和配对显着性测试下保持领先地位。一项包含 11 个数据集的研究表明,语料库导航并不是检索的通用替代品:它在 5 个数据集上显着获胜,在 3 个数据集上打平,在 3 个数据集上输了。它有助于具有可恢复主题分类的单域语料库,但在开放域事实池或击败顶级聚类的同质表格语料库上,平面检索仍然更可取。我们将这种范围区别描述为基于知识的系统的设计指南。代码可在 https://github.com/dukesun99/Corpus2Skill 获取。