论文

FORGE:用失败反馈共同优化提示与训练数据

Failure-Guided Co-Evolution of Prompts and Training Data

模型训练合成数据

摘要

自动提示优化(APO)通过修改任务反馈的提示来改进语言模型程序,但它通常会固定其训练数据。针对相同实例的反复优化将反馈限制在这些数据中已经代表的弱点,从而导致相关的故障条件未被探索。因此,我们将每次失败视为一个双重信号:它既表明应如何修改提示,又表明应综合哪些新的训练证据。我们引入了 FORGE,这是一个故障引导框架,可共同演化提示和训练数据。 FORGE 将不完美的执行抽象为可重用的故障模式,并通过四种互补的突变策略合成新的训练数据。已验证的实例会反馈到提示搜索中,从而允许更新的提示暴露下一个数据需求。在八个异构基准中,FORGE 的总得分比未优化的基准提高了 16.52 个百分点,并且优于所有评估的 APO 基准。合成的数据也转移到 FORGE 之外:在转移研究中,他们在匹配的优化预算下将所有九个 APO 比较提高了 2--9 个点,将所有三个 GRPO 比较提高了 4--8 个点。这些结果将失败建立为即时优化和数据合成之间的共享接口,并显示了共同调整模型被指示做什么和从中学到什么的好处。