论文

RECOM:开放式 Reddit 问答自动指标的有效性歧视权衡

RECOM: A Validity Discrimination Tradeoff in Automatic Metrics for Open Ended Reddit Question Answering

模型评测评测方法与指标

摘要

自动指标是评估 LLM 生成的文本的默认值,但指标悄悄地被要求完成两项工作:区分真实内容对齐和表面重合(有效性),并区分更好的系统和更差的系统(区分能力)。在开放式、意见驱动的问题回答方面,两人处于紧张状态。我们引入了 RECOM(Reddit 模型对应评估),这是一个包含 15,000 个 r/AskReddit 问题(2025 年 9 月)的无污染评估数据集,每个问题都与其真实的社区回复配对,这些回复反映了每个评估模型的训练截止日期。针对每个回复对每个指标与随机扰乱本底噪声配对的五个开源 LLM (7--10B) 进行评分,我们发现没有一个指标可以很好地完成这两项工作。余弦相似度将真实答案与随机答案分开(Cohen 的 $d \approx 2$),但无法对五个模型进行排名($|d| < 0.1$); BERTScore 精度似乎对模型进行了排名(原始 $|d|$ 最高为 0.63),但是一旦控制了响应长度,它就会崩溃为 $|d| = 0.09$,其有效性很弱($d \大约 0.8$,而余弦的 $\大约 2$)。因为每个指标都对相同的输出进行评分,所以这种有效性-歧视权衡是指标的属性,而不是模型的属性,我们认为它源于表示设计。三位独立的 LLM 评委重现了有效性差距,同样也只是微弱地区分了五个模型。我们建议在两个轴上报告指标,并具有明确的随机基线下限。 RECOM 已公开发布于 https://anonymous.4open.science/r/recom-D4B0