论文

超越分数:理解总结评估中的 LLM 评判机制

Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation

模型评测模型行为与机制分析

摘要

基于 LLM 的自然语言生成 (NLG) 质量评估器被广泛部署为评分工具和自动训练信号,但它们分配评级的内部程序仍然知之甚少。我们通过跨 NLG 质量的可读性和充分性维度的八次攻击扰动分类法来机械地研究此过程,一个生成管道,可生成具有受控错误强度和显式 词元级 修改图的配对干净和损坏摘要,以及因果跟踪、logits 镜头词汇投影和应用于 Themis 的注意力头剔除的四组实验组(Llama-3-8B) 和普罗米修斯 (Mistral-7B)。两个评估器都实现了一个结构化、连贯的评估管道,分两个阶段运行:在第 15 层之下,注意力执行局部误差比较并将结果路由到最终输入位置;在其上方,MLP 级联集成信号并写入评级,决策在急剧后期层的残余流中具体化(Themis 上的 L = 26,Prometheus 上的 L = 25)。此外,相同规模的基础模型控制(Llama-3-8B)再现了布线架构和结晶,但没有再现阶段分离,隔离了微调专门安装的两个机制,抑制了最后位置的L15以下MLP贡献以及结晶深度的两层推进,表明微调雕刻了现有的基板,而不是从头开始构建管道。我们在 https://github.com/himil-v/judge-mech 发布源代码和数据