论文

SESSE:草图、扩展、排序、总结、评估——通过结构化分解实现LLM-as-Judge评估

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

模型评测评测方法与指标

摘要

LLM-as-judge评估把回答质量评估简化为单一的整体A/B偏好选择,没有机制来分离是哪些质量维度驱动了偏好,也无法区分模型错误与真实的标注歧义。我们提出SESSE(Sketch, Expand, Sort, Summarize, Evaluate),一个免训练框架,把整体判断分解为直接从评判模型自身错误案例中挖掘出的结构化子问题;它不需要神谕回答、任务专属评分细则或微调。在RewardBench(n=1,000)上,SESSE与思维链基线接近持平,并与经过微调的专家模型RISE-Judge-32B(92.7%)具有竞争力,同时完全免训练。按判据的投票证据为诊断标注歧义与评判模型失效模式提供了可解释的审计轨迹,这是单一整体输出token所无法提供的。

SESSE:草图、扩展、排序、总结、评估——通过结构化分解实现LLM-as-Judge评估:论文配图
图1:SESSE用结构化分解取代整体性判断——准则从裁判自身的错误案例中自动涌现,产生按准则的投票证据。