论文
共享裁判、学习推迟:专精化在何处助力LLM评估
Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation
摘要
智能体系统生成输出的速度快于人工审查。我们对比两种LLM评估器专精化策略:专用裁判权重,或基于规则的推迟(deferral)策略以安全地接受判断。在99,952个条件于评分细则(rubric)的样本上,正确的评分细则使准确率提升2.11分,而错误的评分细则使性能下降2.66分。将训练数据按八种准则切分给八个LoRA专家会使准确率降低10.05分,并将5%误差界覆盖率从24.44%降至5.43%。这一损失与模型规模和训练设置无关,且大部分性能可通过从统一裁判热启动专家来恢复。对数据预算的扫描确认,从头训练的专家专精化没有实证收益。热启动的切分看起来与统一模型相当,但在数据有限时,统一训练优于切分训练,只有在统一训练进入平台期之后专精化才有益。结果在HealthBench上同样成立:医生制定的评分细则提升准确率,而有缺陷的细则使性能退化。与权重专精化不同,推迟策略能实现高效的评估。在RewardBench 2上,轻量推迟头构成0.6B-4B-8B的奖励级联,无需修改核心打分。在20个切分上,该级联达到89.40%的准确率,而独立的8B裁判为84.75%,计算量仅为41.5%,并满足95%风险约束。基于边距(margin)的推迟需要高得多的计算成本才能达到相同准确率。该设计可跨模型泛化,用轻量DeBERTa前端改进了Tulu-3-8B和Skywork-8B的表现。我们导出简单而稳健的评估器设计规则:统一裁判训练,或热启动切分模型,并使用经审计的推迟级联以实现低成本、可靠的LLM评估。