论文
DISCO:分离证据查找与推理,扩展分布式长上下文处理
DISCO: Distributed Long Context Scaling with Grounding-Reasoning Disaggregation
摘要
虽然大语言模型 (LLM) 宣传了百万个词元上下文窗口,但推理质量通常会随着输入的增长而崩溃——这种现象称为上下文腐烂。这种失败源于整体架构中的结构纠缠,其中上下文基础的巨大搜索负担耗尽了复杂推理所需的表示能力。为了解决这个问题,我们提出通过分布式长上下文缩放(DISCO)进行基础推理分解。受 Apache Spark 等分布式计算框架的启发,DISCO 将长上下文划分为一组专门用于并行、本地化基础的 Worker LLM。中央驱动程序LLM通过强化学习 (GRPO) 进行培训,以优化规划,通过动态地将查询映射到原子提取任务并减少收集的证据来综合最终答案来协调执行。通过将推理与原始上下文噪声隔离开来,DISCO 有效地消除了上下文腐烂。在 RULER-QA(1M 词元)上,它在标准基线崩溃的情况下保持了 78.4% 的准确率。此外,它在 LongBench v2 上的性能比全上下文模型高出 9.8 分,与 Gemini-3-Pro-Preview 等前沿模型相匹配,同时将推理成本降低了 80% 以上,为稳健的长上下文推理建立了高效范例。