论文
当智能体陷入沉默:LLM文档合成中的输出生成容量与格式-成本分离
When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis
摘要
由LLM驱动的编码智能体存在一种鲜被理解的失败模式,我们称之为输出停滞(output stalling):智能体在尝试生成大型、重格式文档时悄然返回空响应。我们提出一个通过三项贡献来解释并预防该失败的理论框架。(1)我们提出输出生成容量(Output Generation Capacity,OGC),形式化度量智能体在当前上下文状态下实际产出内容的能力——它不同于原始上下文窗口,且经验上小于后者。(2)我们证明格式-成本分离定理:对任何开销乘数$μ_f > 1$的格式,延迟模板渲染在token效率上始终不低于直接生成,并给出节省量的紧致界。(3)我们形式化自适应策略选择,一个将预估输出成本与可用OGC之比映射为最优生成策略(直接、分块或延迟)的决策框架。我们通过跨三个模型(Claude 3.5 Sonnet、GPT-4o、Llama 3.1 70B)、四类文档的受控实验以及隔离各组件贡献的消融研究验证该理论。延迟渲染在所有条件下将LLM生成token减少48-72%,并彻底消除输出停滞。我们将该框架实现为开源MCP服务器GEN-PILOT,证明该理论可直接转化为实用工具。