论文
自回归模型条件化中的隐性偏差
Hidden Biases in Conditioning Autoregressive Models
摘要
大语言模型与音乐模型正越来越多地用于受约束生成:押韵诗句、固定格律、修补(inpainting)或填充(infilling)、指定位置的结尾以及其他全局形式要求。这些系统往往表现得惊人地好,但所诱导的程序通常并不是对底层自回归模型的精确条件化。这造成了一种隐藏的推断偏差,有别于人们更熟知的继承自训练集的偏差:相对于真实的受约束分布,样本发生扭曲,且一般无法保证完整覆盖可行解空间,也无法保证对有效补全的条件概率正确。我们为自回归模型形式化了若干精确推断任务,并证明了相应的难度结果。对于下一词元概率可在多项式时间内计算的简洁表示自回归模型,精确的句子级最大后验(MAP)解码是NP难的。这一难度在一元(unary)与韵律(metrical)约束下依然存在。在采样方面,即使对固定长度终止事件这类正则约束,精确的条件化归一化也是#P难的。与有限状态马尔可夫模型不同,一般自回归模型对这些任务不存在有界状态的动态规划。这些结果为神经解码文献中的一个标准论断提供了形式化:局部自回归采样容易,而在全局形式约束下的精确解码与精确条件化在一般情况下计算上不可行。