论文
泛化还是记忆?国际象棋训练语言模型的脆弱性测试
Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models
摘要
近期工作在国际象棋数据上微调语言模型,并报告很高的基准分数,以此作为证据表明所得模型能够理解国际象棋规则、以专业水平进行完整对局,或生成以专家知识为依据、人类可读的解释。我们训练了KinGPT,一个仅在(局面,最佳着法)对上训练的2500万参数字符级语言模型,它在600题的N步杀谜题套件上超过30亿参数的ChessGPT,并在20主题谜题基准上超过40亿参数的C1-4B。我们检验了现有文献中关于国际象棋训练语言模型的若干论断,并主张其亮眼的基准表现很大程度上可由模式匹配解释。我们还展示了LLM-Modulo这一验证器在环框架如何在国际象棋N步杀谜题上将RedPajama 3B的最佳着法准确率从1.2%提升到21.2%、着法生成有效率从19.3%提升到95.3%,与ChessGPT在国际象棋专用网络语料上微调所获增益相当,而成本仅为后者的一小部分。我们的结果说明,对于定义清晰的领域,将通用LLM与外部验证器配对,为直接在合成数据上训练提供了一种更灵活的替代方案。为便于复现,我们开源了全部训练/评估代码、数据集、谜题样本与KinGPT模型检查点。