论文
RLMOpt:借助递归语言模型的自适应提示词优化
RLMOpt: Adaptive Prompt Optimization via Recursive Language Models
摘要
提示词优化器自动搜索能提升语言模型性能的提示词,但现有方法依赖预定义的优化流程:算法决定探索哪些候选以及搜索如何推进,而语言模型只负责生成或改写提示词提案。我们提出RLMOpt,一种通过递归语言模型(RLM)让搜索策略本身由语言模型驱动的提示词优化器。RLM智能体在基于工具的环境中运行,检查任务信息、分析失败、生成候选、分配评估预算并决定何时停止。一个确定性框架(harness)对智能体形成补充,强制执行客观评分、基于Pareto的选择和回归约束。我们在四个基准上评估RLMOpt:结构化临床信息抽取(Chia)、多跳问答(HotpotQA)、可验证指令遵循(IFBench-2025)和多轮工具调用智能体(BFCL)。在单种子下的对等比较中,RLMOpt在全部四个基准上取得最佳保留集分数,并在四任务均值上领先(0.610对GEPA的0.589)。跨种子重复每个基准得到11组对等的基准-种子比较,其中RLMOpt在9例中胜过GEPA。在全部11次运行中,它从未产生低于其种子的提示词,而GEPA有两次跌破起点。它也更高效,以更少的搜索rollout取得这些结果,且产生的提示词大小仅为GEPA的27-79%。我们的结果进一步表明,优化收益主要由种子提示词中的可用提升空间决定,而非搜索预算。因此,高效优化依赖于以最小搜索可靠地达到可用提升空间。