论文

TPBench:对话压缩的转折点基准

TPBench: A Turning-Point Benchmark for Dialogue Compression

模型评测基准与评测资源

摘要

对话压缩器可以保留全部事实却丢掉改变它们的那个轮次:用户更正价格、推翻选择或增加约束。我们称这种失败为转折点驱逐。单一总体保留分掩盖它,因为该分数混合了用户最初想要的与现在想要的。我们提出TPBench,在共同名义保留预算下评估三个互补的信息目标:P1询问用户最初目标;P2询问用户修订过的槽位的当前值;P3在带晚期标注槽位更新的对话中同时问两者。当前值答案来自MultiWOZ与SGD的人工对话状态标注,初始目标答案是首条用户轮次的第一句,两者都不需要新的众包。探针级评估对压缩方法的排名不同:在0.30保留比例的联合探针上,所有受测压缩方法在主Llama读取器下都低于全上下文;删除携带更新的轮次急剧降低当前值准确率,删除匹配的无关轮次则不变。Mistral读取器重复了P2/P3排名与联合探针差距。当前值恢复在LongMemEval-KU与中文RiSAWOZ上额外检验:全上下文准确率最高,近期性在两项评估中都是压缩方法中均值最高者。