论文

认知准确性的词元税:比较基于文档的生成人工智能应用的 RAG 和长上下文架构

The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications

模型评测模型能力评测

摘要

基于 大语言模型 构建的基于文档的助手越来越多地用于高风险、知识密集型工作。然而,它们的有用性可能取决于证据在生成之前如何分配。我们通过比较两种基础架构来研究这种说法:(a)检索增强生成(RAG),检索一些相关段落,以及(b)长上下文提示,在上下文中加载整个文档集合。我们将它们视为准确性成本边界上的两种“认知访问”制度。我们使用“认知准确性”来捕获依赖于正确证据的模型正确性。我们认为更广泛的访问(通过长上下文)可以增加它,但会产生“词元税”(即,由于更大的输入词元消耗而导致成本大幅增加)。我们通过制造安全训练的案例研究来探讨这一框架。使用经过专家验证的基准,我们评估了三台机器、两个小型语言模型和三种检索/上下文提示方法的 972 个答案。长上下文提示实现了最高的正确率(语义 RAG 为 73.1%,而语义 RAG 为 65.4%),但每个查询标记成本为 26 倍。我们将这种差距解释为更广泛的证据获取的象征性税收。我们仔细讨论了我们的研究结果对资源有限的组织的影响。