论文
研究机器翻译中高效推理部署的量化权衡
Studying quantization trade-offs for efficient inference deployment in machine translation
摘要
在实际服务器环境中部署 大语言模型 会带来挑战,因为系统需要提供低延迟的高质量响应。量化是减少内存占用和提高推理效率的常用方法,但很少在受控的编排级工作负载下评估其对延迟和吞吐量的影响。在这项工作中,我们研究了 EuroLLM \citep{martins2025eurollm} 跨 1.7B 到 22B 三种模型大小的量化权衡,以便在单个 A100 或 H100 GPU 上高效部署。我们证明,将文档分块策略与 W4A8 或 W8A8 量化相结合可以改善各种工作负载下的延迟吞吐量帕累托曲线。此外,由于标准机器翻译(MT)基准依赖于孤立的句子并且无法捕获长上下文动态,因此我们引入了基于 DocHPLT \cite{o2025dochplt} 的文档级评估,以评估文本分块策略如何影响量化下的翻译质量。我们的结果表明,对于某些量化格式、翻译方向和模型,标准分段级评估可能会低估量化和长上下文文档翻译之间的相互作用。总的来说,我们的实验表明,推理效率和翻译质量之间的权衡不仅取决于量化格式,还取决于文本分块策略的选择。