论文
当梯度碰撞时:LLM法官多目标提示优化的失败模式
When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges
摘要
针对特定问题或领域定制 LLM 判断通常需要同时跨多个评估标准优化其提示。文本梯度方法可以针对单个判断标准自动执行此操作,但它们会产生自然语言批评,而不是数值向量。因此,多任务学习的冲突解决工具包(PCGrad、MGDA)不适用于这种多目标文本梯度设置。我们将 TextGrad 扩展到多目标设置,并通过改变损失、梯度和优化器 LLM 共享的跨目标信息量来测试文本梯度优化器的四种分解模式。我们发现,当梯度 LLM 必须联合提供多个标准的反馈时,梯度的任务重点下降了 59%(10 分中的 9.0 到 3.7)。另外,我们观察到天真地将单目标优化指令组合到单个提示中会使 Spearman rho 从 0.305 降低到 0.220 (-0.085)。这些结果确定了两种可分离的故障模式:优化时间梯度稀释和推理时间指令干扰,它们共同限制了使用文本反馈的多目标判断优化的设计空间。