论文
通过广义幂均值使用温控判决聚合进行人工智能系统评估的自适应严谨性
Adaptive Rigor in AI System Evaluation using Temperature-Controlled Verdict Aggregation via Generalized Power Mean
摘要
基于 LLM 的人工智能系统的现有评估方法,例如 LLM-as-a-Judge、判决系统和 NLI,并不总是与人类评估很好地吻合,因为它们无法将其严格性适应应用领域。本文提出了温度控制判决聚合(TCVA),一种将五级判决评分系统与广义功率均值聚合和直观的温度参数 T [0.1, 1.0] 相结合来控制评估严格性的方法。低温会产生适合安全关键领域的悲观分数;高温会产生适合对话式人工智能的宽松分数。对具有人类 Likert 尺度注释的三个基准数据集(SummEval 和 USR)进行的实验评估表明,TCVA 实现了与人类判断的相关性,与 忠实性 上的 RAGAS 相当(Spearman = 0.667 vs. 0.676),同时始终优于 DeepEval。该方法在调整温度参数时不需要额外的 LLM 调用。