论文
会下棋也会解释着法的语言模型
Language Models that Play Chess and Explain Their Moves
摘要
现代象棋引擎是沉默的专家:以超人水平对弈却不解释着法;语言模型能生成貌似合理的解释,但薄弱的棋力限制其解释的效用。我们提出Queen——4B参数的棋类语言模型,能解释其着法与计划,同时以典型特级大师水平对弈。我们的新框架经互补组件实现领域推理:编码器-解码器架构与迭代蒸馏算法。该架构通过交叉注意力把沉默的专家棋编码器与指令微调LM整合,经问答课程训练以从编码器表示中提取棋概念。在此领域适配模型之上,我们以Bellman更新的自然语言类比迭代改进其解释:模型分析其顶级候选着法后的局面并把它们整合为对当前局面的解释,再蒸馏回模型。七次迭代后模型获得超900 Elo分(1782到2697),在对弈强度与解谜准确率上都大幅超越全部前沿模型——尽管参数少三个数量级。此外基于LM的评估显示其解释流畅、连贯性接近GPT-5.6-Sol(high)。架构与训练程序的通用性提示了把语言模型应用于存在沉默专家编码器的领域(游戏、机器人、计算机使用)的配方。