论文

修复了 RAG 压缩导致读取器测量缩放比例崩溃的问题

Fixed RAG Compression Collapses Measured Reader Scaling

模型评测评测方法与指标

摘要

检索增强生成(RAG)压缩论文通常在一到三个读者上评估压缩器,并将压缩证据层视为评估中立。我们证明这个假设是错误的:固定压缩可以提高平均准确度,同时隐藏读取器升级和逆转模型排名。在 20 个阅读器和 4 个 QA 基准和一个摘要基准的 10 个域方法设置中,压缩增益随着阅读器基线的增加而降低(十个设置中的九个显着,p < 0.05)。通用摘要翻转了 LongMemEval-S 上 31% 的成对模型排名,固定的 HotpotQA 压缩器隐藏了从 Qwen 7B 到 GPT-4.1-mini 的 80% 的原始升级。两种相反的力量解释了这个悖论:压缩通过消除弱读者无法过滤的噪音来拯救弱读者,并通过丢弃强读者本可以使用的细节来伤害强读者。该模式出现在结构化编译、通用摘要、三个训练有素的压缩器系列、以查询为中心的摘要以及对九篇已发表的压缩论文的外部审计中。我们发布了 ragscale,这是一个基于 177,000 个行级压缩转换构建的工具包,因此任何压缩文件都可以在一天内审核三个阅读器的阅读器扩展。