论文

理解LLM在多实例处理中的性能退化:实例数量与上下文长度的作用

Understanding LLM Performance Degradation in Multi-Instance Processing: The Roles of Instance Count and Context Length

模型评测上下文与知识上下文工程模型能力评测

摘要

用户经常依赖大语言模型(LLM)处理多个文档或对若干实例执行分析。例如,分析若干影评的总体情感,需要LLM逐条处理每条影评的情感,才能给出最终的聚合答案。尽管LLM在这类单个任务上的表现普遍较高,但关于LLM处理多实例输入时表现如何的研究却很少。本文对LLM在多实例处理(Multi-Instance Processing, MIP)上的能力进行了全面评估,所涉任务均为其单独完成时表现出色的任务。结果显示,所有LLM都遵循同一模式:在实例数较少(约20-100)时性能轻微下降,随后在更大实例数下发生性能崩溃。至关重要的是,我们的分析表明,虽然上下文长度与这种退化相关,但实例数量对最终结果的影响更强。这一发现提示,在为MIP优化LLM性能时,应同时关注上下文长度,尤其是实例数量。