论文

像人类检查员一样进行判断:具有长式答案的生成任务的加权重要性多点评估框架

Judge Like Human Examiners: A Weighted Importance Multi-Point Evaluation Framework for Generative Tasks with Long-form Answers

模型评测评测方法与指标

摘要

在具有长式答案的生成任务中,评估模型响应的质量仍然具有挑战性,因为预期答案通常包含多个语义上不同但互补的因素,应将这些因素分解以进行细粒度评估。最近的评估方法依赖于任务级标准或问题感知清单。然而,他们仍然 1)很难评估响应是否真正基于所提供的上下文; 2)未能捕捉到参考答案不同方面的异质重要性。受人类审查员的启发,我们提出了一个加权重要性多点评估(WIMPE)框架,它将每个参考答案分解为加权上下文绑定评分点。两个互补的指标,即加权逐点对齐(WPA)和逐点冲突惩罚(PCP),旨在衡量模型响应和参考答案之间的对齐和矛盾。对 10 项生成任务的广泛实验表明,WIMPE 与人类注释实现了更高的相关性。