论文

MATCHA:通过对比语义对齐来匹配文本

MATCHA: Matching Text via Contrastive Semantic Alignment

模型评测评测方法与指标

摘要

可靠的评估对于理解 大语言模型 (LLM) 的性能至关重要,但当今的首选指标,即词元重叠分数(例如 ROUGE)和基于嵌入的度量(例如 BERTScore),经常会误判文档的语义相似性。我们的研究表明,词元重叠指标和基于嵌入的指标通常都会为彼此直接矛盾的文本分配几乎相同的分数,从而可能掩盖基本错误。我们引入了 MATCHA,一种自动度量,它联合奖励与参考的语义一致性并惩罚矛盾。 MATCHA 采用双视角来衡量(i)与黄金文本的接近度和(ii)与对抗性产生的反事实矛盾的距离。在八个公共基准中,与问答、图像描述文本生成、自然语言推理、摘要和语义文本相似性任务上的人工注释相比,MATCHA 的表现优于流行的指标。在 TruthfulQA 数据集(即没有训练集的数据集,其中没有基于嵌入的指标可以在本地进行训练)上,在将文本与参考匹配方面的改进比 ROUGE-L 提高了 18.38%,比 BERTScore 提高了 20.82%。定量比较和定性人类评估都证实了 MATCHA 的有效性和有效性,并揭示了现有指标的根本弱点。与用作类似于 BERTScore 的度量的 23 个嵌入模型(包括最先进的模型)相比,MATCHA 仍然是仅根据参考区分正确与错误陈述的最准确的模型。我们的代码和指标是公开的(https://github.com/Siran-Li/MATTCHA)。