论文
PFN-TS:以先验数据拟合网络进行上下文老虎机汤普森采样
PFN-TS: Thompson Sampling for Contextual Bandits via Prior-Data Fitted Networks
摘要
汤普森采样是上下文老虎机广泛使用的策略:在每一轮中,它都会从贝叶斯后验中采样奖励函数,并在该样本下贪婪地行动。先验数据拟合网络 (PFN)(例如 TabPFN v2+ 和 TabICL v2)是实现此目的的有吸引力的候选者,因为它们在单次前向传递中近似贝叶斯后验预测分布。然而,PFN 预测嘈杂的未来奖励,而汤普森采样需要潜在平均奖励函数的不确定性。我们提出了 PFN-TS,一种汤普森采样算法,它使用子采样预测中心极限定理将 PFN 后验预测转换为平均奖励样本。该方法根据 $O(\log n)$ 数据集前缀的几何网格而不是先前预测序列方法中使用的完整 $O(n)$ 预测序列来估计后验方差,并在各轮中重复使用 TabICL 的缓存表示。我们证明了子采样方差估计器的一致性,并给出了贝叶斯遗憾界限,将 PFN-TS 遗憾分解为 PFN 先验加近似项下的精确后验采样遗憾。根据经验,PFN-TS 在非线性合成和 OpenML 分类转老虎机基准中实现了最佳平均排名,在线性和 BART 生成的奖励上保持竞争力,并在离线移动健康评估中获得最高的估计策略价值。代码可在 https://anonymous.4open.science/r/PFN_TS-36ED/ 获取。