论文

上下文压缩让智能体付出什么代价?任务完成度指标未揭示的交互成本

What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

模型评测上下文与知识上下文工程评测方法与指标

摘要

任务完成度是评估上下文压缩的标准指标,但它并不完整:压缩可能在统计上不改变完成度的情况下,迫使智能体重新获取被丢弃的状态,从而增加其交互成本。我们为一类有界视界的工具使用智能体引入了一套受控运行时测量协议来度量重获取成本。智能体在固定的24回合视界内于确定性规划环境中行动。我们改变压缩严重程度,比较丢弃型算子与事实保留型算子,通过受控的oracle干预恢复被丢弃状态,并将工具调用分解为检索与执行。我们在两种任务机制下评估三个模型。在全部六组模型-机制比较中,检索调用均增加,且几乎构成全部新增交互;其中五组经Holm校正后仍显著。在预设的5倍压缩比较点上,任何单元格中完成度变化都不显著。DeepSeek仅在10倍压缩时出现显著完成度下降。GPT-5.5是最清晰的案例:完成度从80%变为85%(p = 1.0),而检索调用从21.0增至63.9(p = .002)。保留干预进一步区分了状态数量、状态类型与内容有效性。随机选择与离线事后oracle相当,而把保留的D状态替换成语义无关内容会使检索增加57%(p < .001)而完成度无显著变化。在第二个环境ALFWorld中,滑动压缩未产生检索激增,说明重获取特征依赖于环境,而非缩短上下文本身固有。总体而言,当与执行相关的状态缺失且必须重新获取时,压缩会施加隐藏的交互成本,而仅看完成度可能无法暴露这些成本。