论文

面向LLM智能体工作流中并行分支的直接潜空间合成

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

模型推理KV Cache

摘要

大型语言模型越来越多地充当代理系统的执行引擎,但它们仍然通过顺序文本接口消耗上下文。这与现代结构化代理工作流程不匹配,在现代结构化代理工作流程中,独立分支在最终综合步骤之前探索子任务、检索证据或生成候选解决方案。现有系统通常通过连接它们的文本输出来合并这些分支,这会丢弃并行结构并产生冗余的预填充计算。在这项工作中,我们引入了 Parallel-Synthesis,这是一个即插即用的框架,使合成器能够直接使用并行工作代理生成的 KV 缓存。并行合成将校准独立生成的分支缓存的缓存映射器与可从该非顺序缓存接口生成的微调合成器适配器相结合。我们使用将合成器暴露给并行缓存上下文的数据来训练并行合成,教授跨缓存分支的聚合,并从基于标准文本串联的合成中提取推理行为。在涵盖数学、科学 QA、代码生成、GAIA 和多智能体数据库诊断的 9 个下游数据集上,并行合成在 7 个数据集上匹配或优于基于文本的合成,并且与其他两个数据集保持接近。它还将首次令牌时间缩短了 2.5 倍至 11 倍,这表明基于缓存的直接合成是一种很有前景的接口,可以在并行代理分支上进行更原生、更高效的合成。

面向LLM智能体工作流中并行分支的直接潜空间合成:论文配图
图 1:用于高级研究的 DAG 代理工作流程示例,其中包含使用并行工作代理进行不同方向的研究。