论文
评判 LLM-as-a-Judge:关于基于 LLM 的自动文本生成评估中的 Rubric 工件
Judging LLM-as-a-Judge: Concerning Rubric Artifacts in LLM-based Automated Text Generation Evaluation
摘要
LLM-as-a-Judge 管道越来越多地用于评估 AI 生成的文本,其假设是判断来自于对某个标题的候选人响应的推理。我们证明这一假设值得进一步审查。仅在标题文本上训练的分类器,无法访问任何评估的响应,在判断输出上实现了不平凡的预测性能。这表明评分细则对可恢复的评估信号进行了编码,从而可以独立于模型输出来部分预测分数。最后,反事实扰动表明,当候选人的反应或标题标准被逆转时,法官往往无法可靠地更新他们的决定。我们的研究结果引起了人们对基于标题的 LLM 评估可靠性的担忧,并强调需要通过 LLM 进行自动化评估的进一步方法学研究。