论文

基于模糊层次分析法与DualJudge的大语言模型结构化多准则评估

Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge

模型评测评测方法与指标

摘要

对大语言模型(LLM)的有效评估仍是关键瓶颈,因为常规的直接打分常产生不一致且不透明的判断。在本工作中,我们将层次分析法(AHP)适配到基于LLM的评估中,更重要的是提出一种置信度感知的模糊AHP(FAHP)扩展,通过由LLM生成的置信度分数调制的三角模糊数来建模认知不确定性。该结构化方法在JudgeBench上得到系统验证,将评估分解为显式准则并纳入不确定性感知的聚合,产生更校准的判断。大量实验表明,清晰值AHP与模糊AHP在不同模型规模与数据集划分上均持续优于直接打分,其中FAHP在不确定的比较场景中展现出更优的稳定性。基于这些洞见,我们提出DualJudge,一个受双过程理论(Dual-Process Theory)启发的混合框架,通过一致性感知的加权自适应地融合整体直接分数与结构化AHP输出。DualJudge取得了最先进的性能,凸显了直觉式与审慎式评估范式的互补优势。这些结果将不确定性感知的结构化推理确立为通向更可靠LLM评估的一条有原则的路径。代码已发布于 https://github.com/hreyulog/AHP_llm_judge。

基于模糊层次分析法与DualJudge的大语言模型结构化多准则评估:论文配图
图1:基于AHP的混合评估框架总览:通过一致性检验、权重推导与结果聚合,整合直接打分、清晰AHP与模糊AHP三种评估方式。