论文

理解LLM评估器行为:面向商户风险评估的结构化多评估器框架

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

模型评测评测方法与指标

摘要

大语言模型(LLM)日益被用作推理质量的评估器,但其在支付风险场景中的可靠性与偏差仍知之甚少。我们提出一个结构化多评估器框架,用于评估LLM在基于商户类别码(MCC)的商户风险评估中的推理,该框架将五准则评分细则与蒙特卡洛打分相结合,以评估理由质量与评估器稳定性。五个前沿LLM在实名与匿名两种条件下生成并交叉评估MCC风险理由。为建立不依赖于某一裁判的参考,我们引入共识偏差度量,通过将每个裁判的分数与所有其他裁判的均值进行比较来消除循环性,从而得到有理论依据的自我评估与跨模型偏差度量。结果显示显著异质性:GPT-5.1与Claude 4.5 Sonnet表现出负向自我评估偏差(-0.33、-0.31),而Gemini-2.5 Pro与Grok 4表现出正向偏差(+0.77、+0.71),匿名化使偏差衰减25.8%。由26位支付行业专家进行的评估显示,LLM裁判给出的分数平均比人类共识高0.46分,且GPT-5.1与Claude 4.5 Sonnet的负向偏差反映出其与人类判断更为接近。使用支付网络数据的真值验证表明,四个模型表现出统计上显著的一致性(Spearman rho为0.56至0.77),确认该框架捕捉到了真实质量。总体而言,该框架为在支付风险工作流中评估LLM-as-a-judge系统提供了可复现的基础,并凸显了在实际金融环境中采用偏差感知协议的必要性。

理解LLM评估器行为:面向商户风险评估的结构化多评估器框架
图7:前沿LLM风险上的人类共识——评估质量。26位支付行业专家依据五项标准(准确性、质量、一致性、完整性、实用性)评估了五个由LLM生成的MCC风险理由。单元格报告均值 ± \pm 标准差,阴影表示每个标准内的相对排名。Final Score列(红色边框)汇总了所有标准。Claude-4.5 Sonnet和GPT-5.1获得最高的总分,其次是Gemini-2.5 Pro、Grok-4和Perplexity Sonar。该专家基线支持与LLM-as-Judge结果进行比较(见图9)。