论文

快速 A/B/n 测试:通过树耦合反馈共享进行精确的多策略比较

Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing

模型评测评测方法与指标

摘要

在线平台越来越多地比较许多自适应决策策略——排名系统、推荐算法、定价规则和语言模型代理——而每次有奖励的交互都可能是昂贵的或有风险的。直接 A/B/n 设计为每个 $J\ge 2$ 政策提供了自己的水平 $T$ 轨迹,因此使用 $JT$ 结果。我们引入了树耦合 A/B 测试 (\TCAB),这是一种针对任意历史依赖上下文强盗策略的精确反馈共享设计。在每一轮中,一棵可预测的树连接当前的政策历史;每个父子上下文动作法则都是最大耦合的,并且在匹配的树边的每个组件内共享一个奖励。每个策略都准确地保留其独立的有限范围轨迹定律,即使这些策略是故意依赖的。如果 $D_{e,t}$ 在第 $t$ 轮记录了树边 $e$ 上的不匹配,则奖励查询的数量满足路径恒等式 $N(T)=T+\sum_{t,e}D_{e,t}$,因此等于 $T$ 加上期望的累积树边总变化。该成本在所选树上的精确边缘局部设计中是有条件最优的,并且当前轮最小生成树在树设计中是近视最优的。对于固定的$J$,每个策略的次线性伪遗憾和预言机操作几乎确定的唯一性意味着$\mathbb{E}[N(T)]=T+o(T)$,而独立运行的$JT$。我们还获得了成对策略对比的有限样本方差界限。奖励模型评估、多项选择语言模型评估和自适应搜索策略的实验证明了成本精度前沿的显着改进。