论文

可微模糊推理层:大型语言模型的单调组合序数推理头

Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models

模型架构新型架构

摘要

要求解释“大多数大多数学生通过”的最先进的语言模型通常会回答“大多数”,尽管组合“大多数”的两个实例会产生更接近“一些”的比例。我们将这种失败归因于架构选择而不是数据不足:标准分类器头将序数类别视为独立标签,没有机制尊重它们的自然顺序或以代数方式组合它们。我们引入了可微模糊推理层(DFIL),这是一个双路径预测头,将标准分类器与基于一组有序隶属函数的标量瓶颈分支配对。 DFIL 提供了两个仅标签头无法继承的结构原语:基础数量的单调性,以及通过 t-范数运算进行组合推理,无需任何组合训练数据。标量分支还提供了用于分析残余误差的可解释接口。我们在不同的 LLM 系列的有序自然语言任务上实例化 DFIL。