论文

FLARE:基于小样本学习的自适应反射引擎

FLARE: Few-shot Learning-based Adaptive Reflective Engine

上下文与知识上下文工程

摘要

大语言模型 (LLM) 越来越多地部署在复杂、复合的人工智能系统中,其中性能取决于提示的质量。最近最先进的优化器,如 GEPA(Genetic-Pareto),认为反射指令进化可以超越传统的强化学习和小样本优化。在这项工作中,我们通过引入 FLARE(基于少样本学习的自适应反射引擎)来挑战这种转变,这是一个利用先进的反射机制和一小组少样本参考示例来优化指令的框架。我们使用 GPT-5 系列模型,通过一系列不同的基准评估我们的方法,包括检索增强推理(HotPotQA、MedQA、2WikiMultiHopQA)、工具调用和多标签情感分类(GoEmotions)。我们的结果表明,FLARE 始终优于 GEPA,在每个任务模型对上都获胜:它在 HotPotQA 上实现了高达 +14.2 分的提升(使用 GPT-5-Chat 时为 52.2,而 GEPA 为 42.2),工具调用达到 87.0%(相对于 GEPA 为 81.0%),并将 GoEmotions micro-F1 提升至 52.7%(+15.3)在完整的 5408 个示例测试中使用 GPT-5.1,使 GEPA 的 +5.7 增益增加了一倍以上。除了原始准确性之外,FLARE 还具有惊人的数据效率:在 GoEmotions 上,它仅使用 100 个验证示例即可达到其峰值性能,同时在随机种子中保持比 GEPA 明显更稳定的性能。我们的研究结果表明,虽然反思性指令很强大,但小样本学习的策略优化仍然是最大限度发挥下一代 LLM 潜力的关键前沿。