论文

FBS:在Transformer内建模原生并行阅读

FBS: Modeling Native Parallel Reading inside a Transformer

模型架构Transformer

摘要

大语言模型(LLM)在众多任务上表现出色,但推理仍由严格的逐token自回归主导。现有加速方法大多是对该流程打补丁,遗漏了人类阅读的核心要素:内容自适应的预见、面向分块结构的算力分配,以及预览/略读的训练-测试一致性。我们提出Fovea-Block-Skip Transformer(FBS),通过旁中央凹注意力窗口(PAW)、分块头(CH)和跳过门(SG)向Transformer注入一个因果的、可训练的循环。在多样基准上,FBS在不增加参数的情况下改善质量-效率权衡,消融显示三个模块互补。

FBS:在Transformer内建模原生并行阅读
图1:FBS 模块概览。