论文
LLM-as-a-Judge设定温度的必要性
The Necessity of Setting Temperature in LLM-as-a-Judge
摘要
使用 大语言模型 (LLM) 作为评估模型输出的评判者已成为自动化评估的重要范例。然而,LLM 作为法官设置中解码温度的选择仍然很大程度上是根据经验选择的,关于其影响的系统证据有限。为了解决这一差距,我们系统地研究了温度如何影响不同 LLM 判断模型、提示策略和评估范式的判断行为。我们的结果表明,较高的温度通常会降低判断一致性并增加格式错误,同时也会暴露出在低温解码下往往会受到抑制的潜在不确定性,特别是在模棱两可的情况下。进一步的分析表明,较高的温度可以作为一种探索机制,并可能提高在复杂或不确定的评估场景中的判断表现。总体而言,低温设置更适合优先考虑稳定性和可重复性的任务,而较高温度设置更适合涉及大量模糊性或复杂性的场景,在这些场景中探索法官的决策空间是有益的。这些发现表明,在 LLM 作为法官的系统中,温度不应被视为固定的超参数,而应被视为可控的、依赖于任务的设计选择,以调解可靠性和探索之间的权衡。