论文
经由偏差有界评估迈向可证明无偏的LLM裁判
Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation
摘要
随着AI模型从简单聊天机器人进步到更复杂的工作流,我们日益接近一个事件视界:AI系统将在自主的、自我维持的反馈回路中被使用。任何自主AI系统都依赖自动化、可验证的奖励和反馈;在真值稀疏或非确定性的设置中,这种奖励的一个实用来源是LLM-as-a-Judge。尽管LLM裁判不断改进,文献尚未提出能够以强保证执行标准的系统,尤其是在偏差向量未知或被对抗性发现时。为解决这一问题,我们提出平均偏差有界性(A-BB),一个算法框架,可形式化地保证LLM裁判中任何可测量偏差所造成的危害/影响被削减。在Arena-Hard-Auto上用四个LLM裁判评估,我们在格式化和图式化偏差设置下实现(tau=0.5, delta=0.01)的偏差有界保证,同时与原始排序保持61-99%的相关性,其中大多数裁判-偏差组合超过80%。复现我们发现的代码见https://github.com/penfever/bias-bounded-evaluation。
