论文

AgentAssay:面向非确定性 AI 智能体工作流的省 token 回归测试

AgentAssay: Token-Efficient Regression Testing for Non-Deterministic AI Agent Workflows

智能体系统Agent HarnessAgent任务评测

摘要

自主 AI 智能体正以前所未有规模部署,但尚无有原则的方法论来验证智能体在提示、工具、模型或编排逻辑变更后未发生回归。我们提出 AgentAssay,首个面向非确定性 AI 智能体工作流的省 token 回归测试框架,在保持严格统计保证的同时实现 78-100% 的成本削减。其贡献包括:(1)基于假设检验的随机三值判定(PASS/FAIL/INCONCLUSIVE);(2)五维智能体覆盖度指标;(3)智能体专属变异测试算子;(4)面向智能体工作流的蜕变关系;(5)作为统计决策程序的 CI/CD 部署门禁;(6)把执行轨迹映射为紧凑向量的行为指纹,支持多变量回归检测;(7)按行为方差校准试验次数的自适应预算优化;(8)支持在生产轨迹上零成本测试的轨迹优先离线分析。跨 5 个模型(GPT-5.2、Claude Sonnet 4.6、Mistral-Large-3、Llama-4-Maverick、Phi-4)、3 个场景和 7,605 次试验的实验表明:行为指纹取得 86% 的检出功效(二元测试为 0%),SPRT 把试验次数减少 78%,完整流水线借轨迹优先分析实现 100% 成本节省。实现:2 万余行 Python、751 个测试、10 个框架适配器。