技术实践
阿里业务团队用AI连续17小时自动迭代Agent Prompt
概述
阿里某线上业务Agent研发团队面临的核心问题是:线上Agent的Prompt需要根据badcase持续修改,但人工迭代周期长、覆盖面有限。团队将整个迭代流程封装为Agent可调用的工具与Skill:代码部署工具(把修改后的Prompt部署到测试环境)、评测发起与下载工具(触发自动评测并获取结果)、结果分析工具(对比各版本在测试集上的表现)。为防止Agent为提高评测分数而走捷径(reward hacking),采用训练集/验证集严格隔离——Agent只能在训练集上做决策、验证集用于最终评估。以champion-challenger机制比较候选策略——新版本必须在验证集上超过当前版本才能被采纳。AI在该框架下连续运行17小时完成多轮迭代,其中一轮改进经人工复核后发布上线。该实践的价值在于展示了把Prompt工程从人工迭代转为AI自动迭代的完整闭环,其训练/验证隔离与champion-challenger机制可直接移植到任何有自动评测能力的优化场景。