论文

通过信息增益测量多轮对话中的语义进展

Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

模型评测评测方法与指标

摘要

评估多回合对话具有挑战性,因为质量是在回合中而不是在个人响应中出现的。我们关注信息寻求对话的一个关键维度:语义进展,定义为在对话过程中新的、与问题相关的、非冗余信息的积累。我们将语义进展形式化为问题条件的不确定性减少,并引入一种在嵌入空间中对其进行近似的信息论度量。我们的主要估计器使用具有封闭形式更新的易于处理的高斯公式,而互补的最大熵论证表明了为什么当仅保留二阶嵌入信息时,对数行列式结构会更广泛地出现。该公式产生了理想的理论特性,包括单调性、轮次总信息增益的加法分解以及冗余证据的收益递减。与 LLM-as-a-judge 方法不同,我们的指标在评估时不需要自回归推理,并且对于固定嵌入模型来说是完全可重现的。 MT-Bench、Chatbot Arena 和 UltraFeedback 上的实验表明,尽管仅针对语义进展,但所提出的指标与人类判断实现了竞争性一致性,与几个基于 LLM 的判断相比,MT-Bench 和 UltraFeedback 的对齐得到了改进。值得注意的是,该方法在仅 CPU 执行下对于轻量级嵌入模型仍然有效,这表明可以在不依赖大模型容量的情况下捕获语义进展。