论文
大语言模型 中的分层评分
Hierarchical Grading in Large Language Models
摘要
我们引入了分级 大语言模型 (GLLM),这是一种代数框架,它为 Transformer 的表示空间配备了分级,并通过嵌入、自注意力和训练目标传播诱导加权标量动作。该结构将分级神经网络和分级 Transformer 理论扩展到自回归语言模型,同时保留表达能力、渐近计算复杂性和推理成本。主导的几何图是几何不变量理论。放坡的好处通过放坡环面上的 Kempf-Ness 函数来表达;改进统一架构的等级形成一个开放的凸锥体,其成员资格由希尔伯特-芒福德型标准决定,该标准将等级方向与目标和数据的两个可测量轮廓配对;最佳等级是两个矩图的重合点,以封闭形式给出;普通的 Transformer 显示为锥体边界上的半稳定各向同性点:较大分级系列的一个成员,而不是杰出的最佳值。另外,对于水平分层目标,我们证明了分级先验与其不存在之间的极小极大分离:在所有估计器中,分级和统一目标类别的风险在样本大小的显式窗口中通过几何分层下的水平数量呈指数衰减的因子进行分离。两个配置文件都可以离线估计,因此最佳成绩解决了在训练开始之前经过认证的凸程序。由于评分在训练后被吸收到学习参数中,因此每个 GLLM 都会编译为具有相同架构和推理复杂度的标准 Transformer。