论文
LLM 的判断能比他们生成的更好吗?评估上下文 QA 的任务不对称性、机制可解释性和可迁移性
Can LLMs Judge Better Than They Generate? Evaluating Task Asymmetry, Mechanistic Interpretability and Transferability for In-Context QA
摘要
LLM-as-a-Judge 和自我评估管道隐含地假设评估比生成更容易。我们在受控的上下文问答设置中对此进行了测试,其中上下文通道是唯一的信息源,每个模型都会判断它生成的答案,从而消除了开放域比较的参数知识混淆。在四个基准测试(SQuAD 2.0、DROP、HotpotQA、MuSiQue)和两个模型中,评估并非一律容易:四分之三的生成精度超过了自我评估,多跳 MuSiQue 是例外。注意力分析揭示了原因:评判时对上下文的注意力约为生成时的1/3至1/5,并且几乎不读取候选答案。 LoRA 微调 证实了不对称性不是训练伪影:生成 微调 会导致过度接受,而评估 微调 会降低生成的质量。这些发现挑战了自我评估流程中的核心假设。