最大有效上下文窗口约束下的正确性感知存储库过滤
Correctness-Aware Repository Filtering Under Maximum Effective Context Window Constraints
摘要
上下文窗口效率是基于 大语言模型 (LLM) 的开发人员工具中的实际约束。 Paulsen [12] 表明,所有测试的模型在其宣传的上下文限制最大有效上下文窗口(MECW)之前,其准确性就会下降,这使得上下文构建成为一个质量问题,而不仅仅是成本问题。现代软件存储库通常包含大型非代码工件、编译数据集、二进制模型权重、缩小的 JavaScript 包以及千兆字节级日志文件,这些文件会溢出上下文窗口并推出与任务相关的源代码。我们提出了一个正确性感知的上下文卫生框架:一个预执行、基于大小的启发式过滤器,它在标记化之前拦截存储库扫描,仅使用操作系统级别的 stat() 元数据,开销为亚毫秒级。 RepoCoder、GraphRAG 和基于 AST 的分块等语义检索方法需要在做出任何过滤决策之前进行索引构建和查询时推理。相比之下,我们的框架不需要索引,并且每个文件决策的运行时间<0.01 毫秒。在 10 个真实的开源存储库(22,046 个文件,5 种语言)中,建议的 SizeFilter 在 θ=1 MB 时以 0.30 毫秒的开销实现了 79.6% (\pm13.2%) 的平均标记减少:HybridFilter 实现了 89.3% (\pm9.0%) 的方差,是所有评估的过滤器中的最低方差。对 2,688 个文件的词元密度研究证实了很强的线性相关性(Pearson r=0.997,k=0.250 个词元/字节)。有限范围的评估(18 项任务,CodeLlama-7B-Instruct)在过滤下产生 72% 的文件级准确率,而在基线时为 25%;幻觉频率从 61% 下降到 17%。所有代码和数据均已发布,以确保可重复性。