论文
检索增强生成中的字节精确重复数据删除:跨公共基准的三机制实证分析
Byte-Exact Deduplication in Retrieval-Augmented Generation: A Three-Regime Empirical Analysis Across Public Benchmarks
摘要
本预印本对检索增强生成 (RAG) 管道中字节精确的块级重复数据删除进行了实证分析。我们测量了三种不同操作体系的上下文减少:干净的学术检索(2220 万个 BeIR 段落的字节减少了 0.16%)、构建的企业模式(减少了 24.03%)和多轮会话人工智能(减少了 80.34%)。为了验证质量保留,我们对四种生产 API(Google Gemini 2.5 Flash、Anthropic Claude Sonnet 4.6、Meta Llama 3.3 70B 和 OpenAI GPT-5.1)进行了跨供应商 5 名评委校准小组评估。将五类人在环噪声消除协议应用于面板多数实质性不同(MAT)对,我们确定字节精确重复数据删除引入了零可测量质量回归。审核后,所有四家供应商均通过了清洁和高冗余 RAG 制度中严格的 <5% Wilson 95% 上限 MAT 阈值。这项工作表明,可以在不影响评估级模型质量的情况下确定性地实现大量推理计算节省。