淘天以分层服务和Skills封装GEPA提示优化
概述
2.0 版本把原先「n 个场景 n 套 Adapter」重构为配置驱动:配置层用 Pydantic 定义 TaskConfig 等模型,build_config() 按任务类型一次性对齐输出 schema、答案提取方式与评分函数。引擎层对外暴露 run_optimize / run_evaluate / validate_config 三个 API,内部由 GenericGEPAAdapter 把一次候选评估翻译成批量推理、解析输出、批次评分、生成反思轨迹四步。 组件层提供六个可插拔模块——data.py(加载 json/jsonl/csv,按标签分层切分 train 50% / val 30% / holdout 20%)、inspector.py(给字段画像后并行推断标注字段、任务类型、输入字段并给出置信度,产出 DatasetProfile 与建议种子提示词)、llm.py(基于 litellm 统一 DashScope / OpenAI / Anthropic / Moonshot / 智谱多 Provider,批量并发与 2s→4s→8s 指数退避重试最多 3 次)、parsers.py(json_field/regex/full_text 提取并按 OutputSchema 校验)、scorers.py 与 evaluate.py、feedback.py(规则层 + LLM Judge 深度层)、protocols.py(DataPreparer/OutputParser/Scorer/FeedbackGenerator 四个扩展协议)。 服务层用 FastAPI 组织任务端点,任务状态落在 runs/jobs/{job_id}/ 目录(config.json、job_state.json、progress.jsonl、best_prompt.txt、result.json),支持后台线程运行、取消令牌中断与事后追溯。使用入口为 CLI、HTTP API 与 Claude Code / Qoder Skill,Skill 引导五步流程,后台运行约 15-30 分钟并通过 JSONL 实时报告进度。