论文
相关 Thompson 采样中的 LLM 分组协方差
Structure, Not Belief: Correlated Thompson Sampling from LLM-Derived Covariance in Combinatorial Semi-Bandits
摘要
组合汤普森采样(CTS)为每个臂绘制独立的后验样本,因此其探索动态忽略了臂之间的任何关系。我们研究了这些动态的最小变化:查询一次 LLM 以进行臂的分区,分区通过集群等级上的 RBF 内核变成正定相关矩阵 $Σ$,每轮后验样本使用协方差 $Σ$ 绘制,而 Beta 后验仅根据真实奖励进行更新,因此 LLM 塑造采样器的移动方式,而不是它所认为的。我们给出了理想化高斯采样器的自包含贝叶斯后悔界限,其信息增益分为来自 $K$ 簇结构的 $K\log T$ 项和增长到 $d\log T$ 的岭项:相对于独立采样的 $\sqrt{d/K}$ 改进是有限范围瞬态,仅当簇内相关性趋于 1 时才精确。与 CTS 相比,相关采样器在 $T=2{,}500$ 上的 16 个合成伯努利家族上减少了 19% 的遗憾(使用数据自适应内核的 $T=25{,}000$ 上的遗憾为 6-7%),在 Microsoft MIND-small news benchmark($d=200$ 真实文章)上减少了 41% 的遗憾,而伪观察热启动则没有给出任何结果。具有受控质量的模拟预言机的无 LLM 的 消融 表明,在非结构化实例上,增益是内核形状的属性(随机分区或采样噪声的简单回火,可再现它),而匹配预言机质量的置信注入则无济于事。
