论文
帕累托占优澄清:以 PPO-Lagrangian 对编码 LLM 进行预算约束后训练
Pareto-Dominant Clarification: Post-Training Coding LLMs via PPO-Lagrangian Budget Constraints
摘要
在不明确的指令或用户提示下操作的编码智能体必须决定是提出澄清问题还是直接尝试解决方案。虽然用户的澄清可能会提高智能体解决方案的正确性,但每次来回交互都会产生用户和系统成本,形成明确的准确性与效率权衡。现有的工作研究澄清行为,但没有在可执行的澄清预算下训练策略;基于惩罚的方法通常需要对所有澄清预算水平进行单独的系数调整。我们将澄清制定为约束马尔可夫决策过程 (CMDP),并使用 PPO-拉格朗日对 Qwen2.5-Coder-7B-Instruct 进行后训练,以优化编码准确性,并受到预期的问题预算约束。使用 GPT-4o-mini 预言机模拟器在 HumanEvalComm 上进行评估,所得的策略表明,未调整的澄清行为是帕累托效率低下的:预算有限的策略可以同时实现比基线模型更高的准确性和更低的澄清率。在预算水平上,我们观察到一个对数形的帕累托边界,额外澄清的收益递减。收益不仅仅来自于简单地提出更多问题,还来自于改进的问题定位和在歧义下更好的代码生成。如果没有明确的监督,训练有素的策略会学会不均匀地分配澄清预算,更频繁地询问更艰巨的(多重降级)任务。这些结果表明,不受约束的交互式 LLM 系统可能会系统地低效地使用澄清。