论文
AURA:LLM 作为法官审计的自适应不确定性感知细化
AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing
摘要
大语言模型 (LLM) 越来越多地被用作开放式生成的法官,因为大规模的人类评估通常成本高昂且难以扩展,但他们的偏好仍然不完美地代表人类判断。现有的审计流程通常假设事先可以获得可靠的示例子集或干净的监督信号,例如来自人工注释、启发式过滤或强法官的输出。在 LLM 评估中,这种假设是脆弱的:初始分裂可能会继承判断偏差,而人工验证通常太稀缺,无法大规模定义稳定群体。我们提出了 AURA,一种自适应不确定性感知细化框架,用于在选定的人工验证下审核成对的 LLM 作为法官的决策。 AURA 迭代地学习人类一致性信号,传播可靠的证据,并优先考虑不确定的比较以进行人类审查。关键思想是将对法官的信任视为一种潜在量,随着证据的积累而逐渐完善。我们提供紧凑的公式、稳定的细化程序以及对合成和真实成对 LLM 答案数据的综合评估。