论文
用于常见上下文问答的提示内并行解码
Intra-Prompt Parallel Decoding for Common-Context Question Answering
摘要
在公共上下文问答 (CCQA) 任务中,多个输入问题共享一个公共上下文作为其答案的基础。但是,大语言模型 通常使用独立提示生成每个答案。虽然现有的批处理和缓存技术有助于提高并行性并减少重复计算,但跨提示的问题分离限制了可实现的加速,因为现代 GPU 由于注意力期间的内存瓶颈而未得到充分利用。我们提出了提示内并行解码(IPPD),这是一种新颖的推理方法,可以在单个提示中并行回答多个常见上下文问题。 IPPD 通过在注意力过程中有效共享内存和计算来直接解决瓶颈,因为每个问题的下一个标记都是在单个推理步骤中解码的。 IPPD 使用虚拟位置 ID 和注意掩模操作来生成与标准提示相同的输出,而不需要 微调 或对 LLM 架构进行任何更改。由于所有并行性都发生在提示内,因此 IPPD 与批量推理完全兼容,即使每个提示具有不同的上下文也是如此。我们的实验表明,IPPD 的有效吞吐量是标准解码的 7 倍,且质量不会下降,并且在大多数设置中优于使用 PagedAttention 的前缀缓存。