论文
RCWT:测量 LLM 调用中协调内容的任务预算位移
RCWT: Measuring Task-Budget Displacement from Coordination Content in LLM Calls
摘要
多代理和内存增强型 LLM 系统通常将协调内容、共享状态、先前讨论、工具输出、摘要和角色指令放置在用于当前任务的同一有限提示内。这产生了一个实际的分配问题:当在固定上下文预算下组装调用时,用于协调的每个词元都无法用于任务指令或证据。我们引入了圆桌背景窗口测试(RCWT),这是一种用于测量任务预算位移效应的受控协议。 RCWT 在控制总预算、职位顺序、任务族和评分的同时改变协调内容。在 $W=4096$ 的主要上下文相关召回任务中,三个商业模型通过适度的开销保持在基线附近,然后一旦剩余参考证据下降到几百个标记,就会急剧退化。窗口缩放摘要与特定任务的剩余预算解释一致,而不是固定的百分比阈值,但我们将其视为描述性证据而不是普遍规律。为了测试当任务证据保持完整时固定预算悬崖是否持续存在,我们添加了完整任务消融:完整的任务/参考块保持存在,同时通过扩展总提示长度来增加协调标记。在该设置中,所有测试的调用都可以在 GPT-4.1-mini、Claude Haiku 4.5 和 Gemini 2.5 Flash 中正确返回每个评分字段,协调率高达 95%。这种消融缩小了主张的范围:主要的 RCWT 悬崖最好被解读为任务预算位移,而不是证明协调量本身会导致原始开放式任务的语义干扰。因此,RCWT 是上下文分配预算的测量原语,而不是多代理效益或会话级协调的完整理论。