论文

WDA:联合优化指令与阶段结构的自校正流程

Streamlined Reflective Evolution for Task-Adaptive Self-Refinement Pipelines

模型推理推理验证与自校正

摘要

反射提示优化可以在不更新模型权重的情况下改进大语言模型 (LLM) 系统,但固定架构限制了自我优化的组织方式。我们引入了工作流设计Agent(WDA),这是一个用于简化任务自适应自我细化管道的反思演化的框架。从最小的提示开始,WDA 共同演化阶段指令及其顺序结构。在进化过程中,我们发现重复修改会在单个提示中积累冗余指令。在 WDA 中,我们建议使用 SPLIT 来解决这个问题,它将这些指令重新分配到专门的阶段。三示例反射和本地筛选指导选择性搜索,而校准分数指导帕累托准入和无用跟踪更新的回滚。生成的管道是任务自适应的:它们的指令和深度是从任务数据中学习的,然后针对该任务中的所有测试输入进行固定。我们根据知识、数学推理、多跳问答和指令遵循等五个基准来评估 WDA。在 Qwen3.5-9B 上,WDA 的平均得分为 51.24%,比初始求解器提高了 8.63 个百分点,比没有 SPLIT 的变体提高了 2.60 个百分点。在GPT-4.1-mini上,达到了49.00%,相应增益为5.62和3.69点。这些结果支持任务自适应自我优化,作为更广泛的 agentic 工作流程搜索的补充方向。