论文
DA-RAC:LLM 法官的距离感知校准,实现值得信赖的人工智能审计
DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing
摘要
生成式 AI 系统越来越多地生成现实世界的工件,但它们的功效和有效性通常通过上下文无关的 LLM 评分来评估。这些判断可能会因不相关的上下文参考示例而被错误校准,从而产生错误的信心并允许低质量或有害的输出通过评估。我们将这种故障模式研究为上下文引起的校准错误,并引入 DA-RAC,这是一种用于 LLM 裁判的距离感知参考锚定校准方法。 DA-RAC 为每个判断场景检索语义和结构上相似的标记锚点,按距离对它们进行加权,并将邻域难度暴露为校准和分类信号。在多次运行 LLM 判断评估基准上,相对于零样本、思想链评估和静态锚基线,它改进了校准并降低了错误通过风险。机制分析表明,判断分数随锚点距离而系统变化,而静态参考可能会产生误导性的决策边界。因此,LLM 判断不仅需要更好的模型,还需要经过校准、可审核的参考选择,特别是当使用自动评估来支持高影响力的人工智能生成工件时。判断应该基于相关的、可检查的和有争议的解释工件。