论文
PermuFormer:代数组合中排列表示的多任务预训练
PermuFormer: Multi-Task Pretraining for Permutation Representation in Algebraic Combinatorics
摘要
多样化的预训练已被证明是学习可重用、领域感知表示的有效方法,为下游任务的微调提供了起点。虽然数学人工智能的大部分兴奋点都集中在使用前沿推理模型通过语言媒介解决明确的问题,但狭隘的专业模型仍然是数学人工智能生态系统的重要组成部分。与大型语言模型相比,专用模型通常直接在数学对象本身(例如图形、数字序列)上进行训练,而不是在表征这些对象的文本描述上进行训练。然而,从头开始训练专家的常见做法可能会限制他们开发捕捉数学多方面本质的领域感知表示的能力。在本文中,我们描述了一种针对代数组合中以排列为中心的任务进行预训练的方法。我们引入了 PermuFormer,这是一种在 28 亿个词元多任务、多编码语料库上进行训练的自回归Transformer。我们表明,PermuFormer 是对预训练期间未见的基本任务和更复杂的研究级任务进行微调的有效起点,通常优于从头开始训练的相同架构、基线 MLP 和规模相当的微调通用语言模型。我们还分析了 PermuFormer 学习解决训练任务的一些内部机制。例如,我们表明,虽然某些任务可以直接从提示的内部表示进行线性解码,但其他任务需要多轮生成才能解码答案。