论文

Nash Equilibrium Text:文本生成的博弈论解码框架

Nash Equilibrium Text: A Game-Theoretic Decoding Framework for Text Generation

模型推理解码与生成控制

摘要

文本修改已成为大语言模型的一个组成部分。本文进行了修正,使其承认纳什均衡:token 位置是玩家,词汇项是动作,每个玩家的效用是语言模型的对数条件概率。我们通过证明随着序列长度的增长,纳什均衡比自回归输出具有指数级更高的可能性来激励修订。我们进一步提出了 Nash 解码,这是一种在 $O(1/\varepsilon)$ 时间内达到 $\varepsilon$-Nash 均衡的算法,给出了以提示为条件的 token 联合概率。在实践中,我们使用 大语言模型 的条件概率估计来运行纳什解码,并在问答基准上评估所得的均衡。在 CLAPNQ、PubMedQA 和 CoQA 上,从掩码语言模型获得的纳什均衡比自回归模型获得更高的 F1 和 ROUGE 分数,最高可达 $18\times$,无需任何微调或重新训练,但代价是额外的 测试时 计算。

Nash Equilibrium Text:文本生成的博弈论解码框架的原论文方法或结果图
图 1:复习游戏。每个 token 位置都是一个玩家,其选择是在给定所有上下文 token 的情况下进行评估的。自回归解码使早期的 token 保持固定,而 token 在修订版游戏中进行了修订。我们使用 GPT-2small 进行条件概率估计。在纳什均衡中,没有玩家可以通过改变其 token 来增加其条件概率。详细信息参见附录 A。