论文
压缩感知弃权:当 KV 压缩掩模删除答案证据时,教导 LLM 拒绝
Compression-Aware Abstention: Teaching LLMs to Refuse When KV-Compression Masks Remove Answer Evidence
摘要
KV 缓存压缩通过逐出上下文词元来减少 LLM 推理内存,但是当逐出的词元包含带有答案的证据时,模型可能会产生幻觉,而不是认识到压缩的上下文不足。我们从行为角度解决这一失败问题:据我们所知,这是第一个将压缩感知弃权制定为学习问题的工作,其中模型学会在支持证据在压缩中幸存时做出回答,在支持证据在压缩中不存在时放弃。我们从压缩机生存面具和严格的答案范围构建监督,当证据存在时将示例标记为“有信心”,当证据被删除时将示例标记为“弃权”。在约 2.6K MuSiQue 2 跳 QA 示例上训练的 10.1M 参数 LoRA 适配器在提示式截断下将基本模型幻觉减少了 97%,同时保留了对证据保留示例的正确答案。与仅提示弃权基线(在许多可回答的高保留示例中过度弃权)不同,经过训练的适配器学习条件策略。我们还评估了实际压缩缓存解码下的方法,其中多压缩器训练比基于证据保留示例的无辅助基础产生了 6-22 倍的相对提升。受控删除实验表明,学习行为是由证据内容驱动的,而不仅仅是输入长度。