论文
从搜索到综合:将 LLM 训练为零样本工作流生成器
From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators
摘要
大语言模型 (LLM) 在广泛的任务中表现出色,但其特定于实例的解决方案通常缺乏可靠部署所需的结构一致性。在任务级别对重复算法模式进行编码的工作流提供了一个原则框架,提供了跨实例变化的稳健性、可解释的调试跟踪以及跨问题实例的可重用性。然而,手动设计此类工作流程需要大量的专业知识和精力,限制了其更广泛的应用。虽然自动工作流生成可以解决这个瓶颈,但现有方法要么在不学习任务级模式的情况下生成特定于实例的解决方案,要么无法推广到超出其训练配置的范围。我们提出了 MetaFlow,它将工作流生成视为一个元学习问题:给定一个任务和一个操作符集,该模型学习构建解决方案策略。 MetaFlow 分两个阶段进行训练:在合成工作流数据上进行监督 微调,然后进行具有可验证奖励的强化学习 (RLVR),该学习使用任务中跨问题实例的执行反馈来提高端到端的成功率。由此产生的模型为经过训练的任务生成有效的工作流程,并对未经训练的任务和新颖的操作符集表现出很强的泛化能力。在问答、代码生成和数学推理方面的基准测试中,MetaFlow 在具有单一推理的域内任务上实现了与最先进基线相当的性能,同时在域外任务和算子集上展示了卓越的零样本泛化能力。