论文

多代理人工智能工作流程中的词元优化和上下文窗口管理

Token Optimization and Context Window Management in Multi-Agent AI Workflows

上下文与知识上下文工程

摘要

多代理人工智能工作流程不仅受到模型质量的限制,还受到词元成本、延迟和上下文窗口质量的限制。本文提出了一个用于词元优化和上下文窗口管理的实践框架,该框架基于内部生产仪表板,该仪表板从会议、电子邮件和 LLM 聊天中提取结构化工作项目,并跨工作流路由摘要。描述了六种模式:上下文分层、一次获取/本地处理架构、模式契约提示、词元感知后备链、语义缓存和代理间通信压缩。在生产中,他们将测得的冷负载延迟从大约 3.5-10.5 分钟的操作基线减少到 61-116 秒(六次定时运行),预计减少了 60-70%。它还报告了一项受控情境构成研究:针对 11 种模型配置进行了 2,420 项验证性试验,使用 661 个匿名工作场所项目进行相关性评分。将提示保持在固定的十个项目上,用相同域的低相关性项目替换一些高相关性项目可以提高模型在目标项目上的相关性得分一致性,而仅与高相关性项目相比;我们称之为相关性对比上下文。在全部 11 配对分析中,50:50 信号/噪声条件比 100% 条件提高了相关准确度 +0.077(原始 95% CI [+0.056, +0.098],Cohen d = 0.49,Holm 调整 p < .001,n = 220)。这些细胞不是独立的;九个模型家庭的效果为+0.084(95%区间[+0.064,+0.103]),报告为语料库内描述性比较,而不是总体推断。 Fusion-of-N 的后续发现发现,学习合成并没有击败项目 ID 的机械集合并集。其贡献是模型研究和生产代理实践之间的可测量的工程层:可重复的模式和评估方法,以实现更快、更便宜、更可靠的工作流程。