论文

面向迭代提示优化的对比反思

Contrastive Reflection for Iterative Prompt Optimization

上下文与知识上下文工程

摘要

LLM 代理正在成为信息检索的核心:他们发出检索查询、综合答案,并越来越多地充当 IR 评估的法官。改进控制这些代理的提示是一个优化问题,但在应用的 IR 设置中,它通常看起来不像盲目搜索,而更像调试。工程师需要知道哪些行为失败了,哪些附近的行为仍然有效,两者有何区别,以及即时编辑是否可以在不引入回归的情况下提高保留质量。我们提出了 Contrastive Reflection,这是一种用于代理 IR 工作流程的迭代提示优化框架。该框架从以任务为中心的质量定义开始:QA 代理公开检索或推理跟踪,评分代理公开维度级别的分数和基本原理。这些结构化跟踪用于识别错误锚定的行为片段,添加来自同一区域的附近成功示例,并要求大语言模型教师提出有针对性的提示编辑。仅当验证性能提高时才接受候选编辑,并可选择进行回归检查。我们使用基于树的切片选择器实例化框架,但贡献是对比反射循环而不是树本身。在公共 HotpotQA 检索增强 QA 设置中,一种树选择的对比修复将保留的精确匹配准确率从 51.4% 提高到 60.4%。仅失败和随机证据变体改进较少,并且破坏了更多以前正确的示例。仅进行简单的指令比较,该方法接近现代提示优化器:MIPROv2 达到 59.4%,GEPA 达到 57.0%。结果是 IR 代理的可解释优化循环,旨在使即时修复更易于检查和验证驱动。