论文
SKG-Eval:通过增量语义知识图对多轮对话进行状态评估
SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs
摘要
评估多轮对话系统仍然具有挑战性,因为响应质量不仅取决于当前的提示,还取决于先前建立的实体、声明和对话承诺。现有的自动评估器,包括 LLM-as-a-judge 框架和基于嵌入的度量,在很大程度上依赖于平面或回合隔离表示,这使得它们在检测矛盾、主题漂移和实体不一致等长期问题方面效果较差。为了解决这个问题,我们提出了 SKG-Eval,这是一个准确定性和可解释的框架,它将对话建模为实体、关系和跨轮承诺的不断演变的语义知识图(SKG)。该框架通过结构化三元组提取逐步更新图表,并计算三个互补信号:(i)局部相关性,测量与当前提示和可选参考的一致性; (ii) 历史一致性,评估新引入的信息如何使用基于图和嵌入驱动的信号与先前的对话上下文相联系; (iii) 逻辑连贯性,由几何矛盾引擎评估,该引擎无需依赖 NLI 模型或 LLM 判断即可检测交叉转弯冲突。这些信号通过新近度加权趋势分析自适应地融合并聚合成长度不变的会话分数。在多个基准测试中,SKG-Eval 与人类判断实现了更高的相关性,并显着改进了对扩展对话中远程不一致的检测。此外,该框架还为固定输入生成明确的矛盾证书和确定性分数,从而实现可重复和可审计的评估。总体而言,我们的结果表明,通过语义知识图进行结构化外化状态跟踪为基于 LLM 的对话评估器中的隐式推理提供了可扩展的替代方案。