论文

AI 代理可以模拟 A/B 测试结果吗?代理实验的验证框架

Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation

模型评测评测方法与指标

摘要

A/B 测试仍然是技术行业推出新功能的标准。然而,每个实验都会消耗实际流量、工程工作和数周的挂钟时间。人工智能代理(以行为概况和干预的上下文描述为条件)能否足够准确地模拟结果,以便在进行实时流量之前审查候选治疗方法?我们将这个问题形式化为\emph{模拟随机对照试验}(S-RCT),并推导出两层误差分解,将代理近似误差与子采样误差分开,从而对每个误差进行有针对性的改进。该框架与代理无关:任何行为模型(从微调的专家到通用基础模型)都可以用作模拟引擎。使用现成基础模型的基线 S-RCT 经过 67 项历史营销 A/B 测试的验证,可捕获方向信号(符号重叠 0.70),但系统性地超出了效应幅度。两相周期前校准协议可将平方预测误差(去除不可约测量噪声后)减少 ${\sim}77\times$;受试者内设计——每个智能体都暴露于双臂——将标准误差减少${\sim}2.4\times$。我们讨论了当前方法的局限性,并确定了实验者可以从代理信号中受益的应用。