论文
推理并非免费:LLM-as-a-Judge的鲁棒自适应成本高效路由
Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge
摘要
具备推理能力的大语言模型(LLM)近来被用作自动化评审,但它们在LLM-as-a-Judge场景中的收益与成本仍不清楚。通过对推理型与非推理型评审的受控比较,我们表明:显式推理在需要结构化验证的任务(如数学与编程)上能大幅提升评判准确率,而在较简单的评估中收益有限甚至为负,并带来显著更高的计算成本。这些发现说明,推理应被选择性地而非普遍地使用,且需警惕可能存在的分布偏移。我们提出鲁棒自适应成本高效路由(RACER),将路由形式化为带约束的分布鲁棒优化问题,在固定预算下动态选择推理型或非推理型评审。RACER通过KL散度不确定性集合显式地考虑分布偏移,拥有高效的原始-对偶算法,并享有包括最优策略唯一性与线性收敛在内的理论保证。大量实验表明,RACER在分布偏移下取得了更优的准确率-成本权衡。
