论文
用于黑盒反馈学习的方差最优控制变量
Variance-Optimal Control Variates for Learning with Black-box Feedback
摘要
现代模型越来越多地通过黑盒预言机(例如人类、优化求解器和提供反馈而不暴露其内部机制的外部工具)进行学习。常见的补救措施是学习(动作)值函数作为控制变量。在本文中,我们首先观察到,即使是精确的动作价值函数也可能与方差最优相差任意远。我们证明了这种差距的出现是因为价值函数最小化了每个动作自己的梯度项中的噪声,而动作仍然可以通过共享的参数影响梯度估计器的其余部分。一个简单的无偏校正,无需额外的预言机成本,仍然可以将其方差减少任意大的因子。受此启发,我们证明残差方差可以通过没有交叉项的动作精确分解。这种分解产生了神经网络参数的封闭形式方差最小化校正,可以通过简单的投影来计算。根据经验,我们的修正持续减少了价值函数留下的方差,并改善了所有任务的学习。所有实验的源代码可在 https://github.com/Zihao-Kevin/black_box_opt. 获取