论文
用于偏离政策评估的预算多源反事实注释
Budgeted Multi-Source Counterfactual Annotation for Off-Policy Evaluation
摘要
离策略评估 (OPE) 根据记录的数据估计目标策略的价值,但有限的行为策略覆盖范围可能会强制进行高方差重新加权或奖励模型外推。反事实注释可以添加有关未观察到的行为的证据,但包括领域专家和大型语言模型 (LLM) 在内的实际来源可能成本高昂、存在偏见或嘈杂。我们研究了上下文强盗 OPE 的此类注释的预算获取。给定特定于源的成本和错误概况,我们在上下文动作对和注释源上制定整数分配问题,以最小化取决于注释计划的估计方差的分量。我们通过第一个注释阈值和本地注释值机制来描述注释何时有价值。对于耦合多源问题,我们开发了一种具有动态编程子例程的主化最小化算法,可以单调改进目标。合成临床和LLM注释的教育老虎机的实验表明,我们的分配方法减少了固定轮廓均方 相对于无注释,误差(MSE)分别为 20.58% 和 10.77%。