论文

多匝综合轨迹双层优化 LLM 微调

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

模型训练合成数据

摘要

虽然 LLM 擅长单轮生成,但它们在长视野、多轮交互方面表现不佳。离线强化学习(RL)提供了一种可扩展的方法,但其性能取决于多转弯轨迹数据的可用性和质量。常见的补救措施是使用 LLM 或模拟器生成的合成轨迹来增强训练,但合成数据的质量高度异质,天真地将所有轨迹视为同等信息会降低性能。我们提出了 BOOST,一个双层优化框架,其中内部层在重新加权数据上训练 LLM,外部层在保留的真实验证任务上训练轻量级重新加权头,分配连续的轨迹级权重,而不需要外部判断。为了支持这种方法,我们得出了一个 PAC-贝叶斯界限,揭示了三向权衡:合成数据增加了多样性,但存在任务转移的风险,同时将权重集中在高质量轨迹上,以牺牲有效样本量为代价提高了经验表现。根据经验,我们的方法始终优于多个基线。分析表明,它增加了与真实数据分布一致的合成轨迹的权重,并表现出更高的定性优点。