论文
论具有成本效益的LLM作为法官的改进技术
On Cost-Effective LLM-as-a-Judge Improvement Techniques
摘要
在基于人类反馈 (RLHF) 管道、基准测试和应用程序层评估的强化学习中,使用语言模型对候选响应进行评分或排名已成为人类评估的可扩展替代方案。然而,输出的可靠性在很大程度上取决于提示和聚合策略。我们对四种即插即用技术(集成评分、特定于任务的标准注入、校准上下文和自适应模型升级)进行了实证研究,以提高 RewardBench 2 上的 LLM 判断准确性,并对随机判断采用统一的噪声控制镜头:集成作为蒙特卡罗平均每次调用噪声,标准注入作为响应间辨别锐化,每个响应得分方差作为不确定信号。集成评分和特定任务标准注入(后者几乎免费)的准确率合计高达 85.8%,比基线高出 13.5 个百分点。校准环境和自适应模型升级也比基线有所改善,但主要受到成本准确性帕累托前沿上的标准+集成的支配。小模型从集成中获益匪浅,使得高精度 LLM 判断能够以低成本获得。我们证明这些技术可以跨模型提供者推广,并对 OpenAI GPT 和 Anthropic Claude 系列进行评估。