论文

相关但不完整:参考悬空作为硬提示压缩中的范例级故障模式

Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression

上下文与知识上下文工程

摘要

硬提示压缩通过独立地对标记、句子或块进行评分并在预算内保留得分最高的单元来降低长上下文推理成本。我们在这个过程中发现了一个结构性失败:独立选择可以分裂依赖的证据对,保留一个成员,同时删除另一个。当保留的文本包含答案但删除的文本定义解释它所需的实体时,我们将结果称为引用悬空。在压缩率为 0.30 时,Beaver 使用 Qwen3-0.6B 嵌入对连贯块进行排序,在三个多跳问答数据集中,34-54% 的桥接示例中的答案路径不完整。在共享的 HotpotQA 桥接器组上,我们测试的所有六台硬压缩器都表现出高达 60% 的悬空率,并且 LongBench-v2 单文档 QA 中的每个文档都至少包含一个悬空引用。在使用 Qwen3-8B 评估的悬空示例中,重新插入缺失的支持段落,同时删除非支持段落以维护 词元预算,可将准确性提高 29-34 个百分点 (p < 0.0001),恢复至少 88% 的与保留两个支持段落的上下文之间的差距。更强的答案模型不会吸收损失:在 MuSiQue 上,GPT-5.5 在压缩上下文上的准确度比在保留两个支持段落的上下文上的准确度低 8.8 分。最后,我们训练一个紧凑的分类器,根据是否需要解释保留的文本来对省略的句子进行排名,并在推理时重新插入没有支持注释的排名最高的候选者。在使用 Qwen3-8B 的 HotpotQA 上,这种自动恢复将精度提高了 4.7 个点,同时压缩率仅从 0.30 更改为 0.31。硬压缩器应该优化相关性和参考完整性。