论文

多轮编码代理中上下文压缩网关的经验成本归因

An Empirical Cost Attribution of Context-Compression Gateways in Multi-Turn Coding Agents

模型评测评测方法与指标

摘要

上下文压缩被广泛提议作为削减 LLM 编码代理词元费用的一种方法,公共基准测试报告称,积极的压缩可以保持任务解决质量。这两个事实并不意味着通常假设的第三个事实:压缩文件读取可以在真正的多轮代理中节省资金。我们在编码代理(Claude Code、Codex)和前沿 LLM(Claude Sonnet、GPT-5)之间安装了一个生产压缩网关(Paritok),并将真实会话的词元清单分解为三个独立的杠杆:工具模式过滤、文件读取和工具输出的内容压缩以及历史摘要。在受控 A/B 运行下单独测量,三者的节省率根本不同。工具模式过滤每回合都会删除固定的区块,典型回合中大约会删除 21K-57K 词元;它与匝数 N 呈线性关系,并且是唯一明确且可重复的正杠杆。内容压缩每回合仅节省约 2% 的缓存定价前缀,但压缩读取会在历史记录中累积,并在以后的每个回合中重新发送,因此其累积节省呈二次方增长,约 3350*N^2 词元(测量),在大约 6 回合内超过固定工具过滤器节省,直到上下文窗口达到上限。非破坏性网关允许代理根据需要拉回原始字节;每次召回都准确地重新发送刚刚压缩掉的一个片段,因此其成本是固定且有界的,而不是乘法爆炸,并且重度召回一次将累积的节省花费回一个片段。最后,强大的单次压缩基准 - 在 25.7% 的压缩率下保留了 86.5% 的 SWE 基准质量,这是通过该网关部署的模型(Paritok-4B,单独报告)实现的 - 与多轮代理成本正交,不能被引用为节省成本的论点。我们将结果提炼成一个可行的方案,让节省词元的努力得到回报。