论文
AI 友好的 LaTeX:使用 LaTeX 代码作为检索增强生成的知识源
AI-Friendly LaTeX: Using LaTeX Code as a Knowledge Source for Retrieval-Augmented Generation
摘要
当答案基于明确的知识源时,大语言模型 可以更可靠地回答有关教科书、讲义和编程练习的问题。检索增强生成(RAG)是一种常见的方法:在回答之前检索文档的相关片段并将其插入到模型上下文中。对于数学和技术材料,原始 LaTeX 源可能是比 PDF 更好的起点,因为它包含在 PDF 提取中经常丢失或扭曲的结构信息、标签、切片命令、宏和作者意图。然而,LaTeX 源代码并不自动对 AI 友好。必须解决交叉引用,必须解释自定义宏,必须识别练习和示例,并且可能需要作者提供的语义元数据。本文介绍了一种集中预处理方法,用于将 LaTeX 源及其编译的辅助文件和可选的作者注释转换为适合在向量数据库中建立索引的 Markdown 和 JSONL 块。