论文
通过即时优化利用 LLM 作为法官对自由文本法律 QA 的处置
Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization
摘要
这项工作探讨了提示设计和法官选择在自由文本法律问答的 LLM-as-a-Judge 评估中的作用。我们检查自动任务提示优化是否比以人为中心的设计有所改进,优化效果是否因法官反馈风格而异,以及优化的提示是否在法官之间转移。我们通过使用 ProTeGi 方法以及两个评委(Qwen3-32B、DeepSeek-V3)在四个任务模型中的反馈来优化任务提示,然后测试跨评委迁移,从而在 LEXam 基准测试上系统地解决这些问题。自动优化始终优于基线,宽松的判断反馈比严格的判断反馈产生更高、更一致的收益。通过宽松的反馈优化的提示比相反的方向更好地传递给严格的法官。分析表明,宽松的法官提供宽容的反馈,产生具有更广泛适用性的提示,而严格的法官则产生限制性的反馈,导致法官特定的过度拟合。我们的研究结果表明,对训练数据进行算法优化的提示可以优于以人为中心的提示设计,并且在优化过程中判断的处置形状提示的普遍性。