论文

贝叶斯过滤的 Transformer 相信什么?预测性蒙特卡罗方法

What does a Bayes-filtered transformer believe? A predictive Monte Carlo approach

模型评测模型行为与机制分析

摘要

贝叶斯过滤的 Transformer (BFT) 是在通过两个步骤生成的序列上训练的 Transformer:首先从先验中提取潜在任务,然后根据该任务绘制观察结果。在自回归对数损失下进行训练,BFT 的下一个标记预测在理想化极限下是由先验定律和条件定律得出的贝叶斯后验预测分布 (PPD)。在实践中,经过训练的 BFT 只是这种理想 PPD 的近似,这就提出了一个解释性问题:经过训练的 BFT 实际上内化了潜在任务的先验和后验是什么?现有的工作通过将经过训练的 BFT 预测与各种“参考”后验的预测进行比较来回答这个问题,每个后验都代表 BFT 可能实现的不同候选算法或计算。这种预测空间比较是脆弱的:不同的后验可以共享相同的后验均值预测。我们使用预测蒙特卡罗(PMC)作为任何 BFT 的通用可解释性工具:仅使用下一代词元生成,PMC 返回潜在任务的隐式先验和后验的近似值,直接在潜在空间中回答解释问题。我们将 PMC 应用于跨越 0-马尔可夫和 1-马尔可夫可交换性的三个程式化任务族。先前在这些设置中报告的现象在潜在空间中仍然可见。代码可在 https://github.com/afiq-aswadi/bft-pmc 获取