论文
编码Agent是强大的提示词优化器
Coding Agents are Strong Prompt Optimizers
摘要
基于搜索的提示词优化器通过迭代搜索改进提示:提出修改、执行新的rollout、为产生的轨迹打分,并只保留能提升验证指标的修改。我们表明这一优化循环并非必要。只需一个静态的Agent轨迹语料库,现成的编码Agent就能直接合成优化后的提示词,既不需要环境访问也不需要验证数据。我们把这一方法称为编码Agent技能蒸馏(CASD)。关键洞察在于反思范围:编码Agent不是在每一步优化中只推敲一小批轨迹,而是编写并执行分析代码来计算语料库级统计量、识别系统性失败模式、检视代表性样例,并把所得洞见提炼为行为规则。在四个Agentic基准(ALFWorld、τ²-bench retail与telecom、SpreadsheetBench-Verified)上,在匹配的数据访问条件下,单次CASD在四个基准中的三个上优于最先进的反思式提示优化器GEPA,在全部四个上优于带验证门控的反思式搜索(SkillOpt),相对未优化基线平均提升16.6个百分点,而GEPA为10.9、SkillOpt为5.3。由于CASD执行的是单次离线分析而非迭代搜索,产出优化提示词的成本约1.60美元——比带验证门控的搜索便宜22倍以上。即便让竞争方法获得额外验证数据与不受限的环境访问,CASD仍在四个基准中的两个上保持领先。这些结果表明,语料库规模的统计反思是提示词优化中迭代搜索的可行替代方案。