论文

LLM-as-a-A-Judge for Human-AI Co-Cretion:一种具有可靠性意识的编码评估框架

LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding

模型评测评测方法与指标

摘要

LLM 越来越多地被用作评估开放式输出的评委,以及人工智能辅助编程中的共同创作合作伙伴;然而,人类与人工智能共同创造环境中的严格评估仍然不够发达,因为判断必须可靠、跨模型具有可比性,并且可以在多轮交互中进行解释。为了解决这一差距,提出了一个由标题驱动的 LLM-as-a-Judge 框架,用于编码和软件工程 (SE) 中竞赛式的人类与人工智能共同创造。该框架是围绕模式约束的判断输出、验证和修复机制构建的,按用户和问题分组和分割以防止轨迹泄漏,以及参与者级非盲上下文。多个 LLM 法官通过多指标协议进行评估,涵盖歧视(ROC-AUC、PR-AUC)、阈值决策质量(MCC)、概率可靠性(LogLoss、Brier 分数、ECE)和法官间一致性(Cohen's 和 Fleiss' k)。通过轨迹级信号进一步检查人类与人工智能的共同创造,包括回合置信度、回合成功、成功时间、修订流失和 CodeBLEU。研究发现,共同创造的成功在早期就集中起来,在第一个观察到的回合中,回合成功率上升至 0.8533,并在第 6 回合稳定在 0.8641。然而,修订行为仍然是异质的,这表明生产性进展可以通过渐进式细化或更广泛的重组来实现。在评审方面,ROC-AUC 的最佳保留分数达到 0.5937,PR-AUC 为 0.6904,MCC 测试为 0.5000,而法官间的一致性总体上仍然较低(平均成对 Cohen's k = 0.1592,Fleiss' k = 0.0696)。总而言之,这项工作提供了一种可审核和可重复的评估方法,将可靠性感知的 LLM 判断与基于轨迹的人类与人工智能共同创造的分析联系起来,为未来的人工智能辅助编码和 SE 提供了实用的评估模板。