论文

Merlin:大语言模型 推理中无损上下文优化的确定性字节精确重复数据删除

Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference

上下文与知识上下文工程

摘要

从大规模检索系统到高级数据管道的数据密集型应用程序越来越受到高度冗余文本语料库处理的瓶颈。我们推出 Merlin,这是一个本地优先、不可知论、高吞吐量的重复数据删除和上下文优化引擎,旨在缓解这些低效率问题。 Merlin 利用高度优化、SIMD 友好的开放寻址平面哈希集与 xxHash3-64 相结合,对文本段落和数据块执行快速、字节精确的重复数据删除。虽然广泛适用于任何文本处理工作流程,但其影响在 大语言模型 (LLM) 生态系统中尤其明显,例如检索增强生成 (RAG)。我们的实证评估表明,输入减少范围从低冗余数据集中的 13.9% 到高冗余管道的 71% 以上,保持了绝对数据保真度。此外,我们通过模型上下文协议 (MCP) 详细介绍了系统的集成架构,从而实现跨主要 IDE 和自治代理的安全、零网络拦截部署。本文概述了以高达 8.7 GB/s 的持续速度处理数据所需的核心算法设计、性能基准和架构原则。