论文
CVaR 政策评估的尾部影响抽样
Tail-Influence Sampling for CVaR Policy Evaluation
摘要
具有相似平均回报的策略在罕见的失败中可能会有很大差异,但准确估计下尾条件风险价值 (CVaR) 可能需要多次昂贵的rollout。当随机工作流程的不同条件组件可以单独查询时,我们会问如何分配固定的评估预算来最准确地估计固定策略的 CVaR。我们得出每个可查询条件律的尾部影响,汇总其不确定性如何影响每次 Bellman 重用的 CVaR。它的方差产生固定设计效率界限和理想Neyman分配。尾部影响采样(TIS)根据初步模型估计这些影响范围,并将新查询重新分配给对尾部最重要的内核;访问锚定变体可以防止初步模型分配不足。在固定维度和正分位数裕度下,TIS 获得了预言机渐进方差和一阶 MSE(包括试点成本),而锚定变体在预言机的两倍以内。我们还描述了一种精确网格机制,其中尾部最优分配和平均最优分配一致。在 CliffWalking 上,在相同的状态转移预算下,TIS 与学习所得占用分布相比,MSE 降低了 41%,与完整rollout相比,MSE 降低了 76%。在冻结的语言模型审核工作流程中,锚定 TIS 在 24 个 MMLU-Pro 设置中的 23 个设置中击败了同样正则化的平均影响力混合,并且与在六次调用 FinQA 审核中rollout的 MSE 相比降低了 2.4-3.4$\time$。