论文
H$^{2}$MT:语义层次感知层次记忆 Transformer
H$^{2}$MT: Semantic Hierarchy-Aware Hierarchical Memory Transformer
摘要
基于Transformer的LLM在许多语言任务上取得了优异的成绩;然而,长输入仍然具有挑战性,因为上下文窗口是有限的,并且预填充延迟和内存随着提示长度而快速增长。因此,平面词元流处理和基于块的检索可能会在与查询无关的文本上花费大量计算和上下文预算。离线索引 RAG 还引入了外部存储和索引管理开销,并且通常将检索到的证据作为原始文本附加,从而增加了预填充成本和延迟。 H^{2}MT 使长上下文推理具有结构感知能力:它离线构建语义层次结构,通过自下而上的后序聚合计算每个节点的内存嵌入,并在推理时从粗到细路由查询以尽早修剪不相关的分支。在 LongBench QA(NarrativeQA、HotpotQA、QASPER)和两种结构化技术文档设置上,H MT 实现了良好的质量效率权衡,提供了具有竞争力的 ROUGE-L 和 F1(如果适用),其峰值 GPU 内存和首次词元时间 (TTFT) 低于即时压缩、内存词元方法和检索增强生成基线。