技术实践

淘天以GEPA闭环自动优化Prompt

上下文与知识模型推理模型评测推理策略与问题分解上下文工程评测方法与指标模型能力评测

概述

淘天团队针对 Prompt 优化依赖人工经验的四个痛点(盲目性高、伪自动化、难以复制、无权衡机制)和评估器两大对齐目标(与人工标注对齐、与线上 CTR/转化率等业务效果对齐),基于 ICLR 2026 论文《GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning》实现自进化系统:主循环由种子提示词、LLM 推理(温度 0.0 批量并发)、评分器(按任务类型选 exact_match / F1 / Cohen's Kappa / Spearman / MAE / pair_f1 / ARI 等指标)、反思与变异四环节组成。 反思分两步——先由 Judge 模型对错误样本做错误定位、Prompt 归因、改进建议三维分析,再由反思模型(温度 0.7)接收「输入+输出+分数+反馈」生成候选 prompt,按帕累托前沿保留多目标最优解而非单一最高分候选,避免单点优化引发指标对抗性退化。系统任务无关,覆盖二分类、多分类、评分、规则判定(Rubric Judge)、聚类、对比(Pairwise Judge)等场景,用户只需提供标注数据与任务目标,由 Inspector 自动推断配置。 文中还给出冻结区/可变区划分(防止删除硬性约束造成 reward hacking)与把长度作为帕累托第三目标抑制提示词膨胀两项治理设计。