技术实践

Amazon.ae AMET Payments 团队用 Claude Sonnet 与 Strands Agents 自动生成支付测试用例

概述

亚马逊 AMET 支付团队负责阿联酋、沙特、埃及、土耳其、南非五个市场约每月 1000 万客户的支付选路、交易与支付能力功能,平均每月上线五个新功能,均需成套测试用例。传统做法下,QA 工程师要通读业务需求文档、设计文档、UI 稿与历史测试准备,单项目耗时约一周,仅测试用例编写一项每年就占用约一名全职工程师。团队为此自研多智能体应用 SAARAM(QA Lifecycle App),基于 Amazon Bedrock 上的 Claude Sonnet 与 Strands Agents SDK 构建:早期把整份需求文档直接喂给单智能体,只会产出“验证支付正常工作”式的空泛用例,而他们需要具体到“阿联酋用户对超 1000 迪拉姆订单用已存信用卡选货到付款时,系统展示 11 迪拉姆手续费并经货到付款网关完成状态流转”这样的粒度。方案历经三轮迭代,走“研究人类认知模式而非只优化算法”的路线,并用结构化输出显著减少幻觉。官方称测试用例生成时间已从一周缩短至数小时,测试覆盖质量同步提升;该数字为自述,未披露样本与统计方式,方案计划先在 AMET QA 团队内部推广,再扩展至其他 QA 团队。