论文
迭代LLM智能体循环的语义早停
Semantic Early-Stopping for Iterative LLM Agent Loops
摘要
多智能体大语言模型(LLM)循环——例如起草的Writer与修订的Critic——几乎总以固定迭代上限(max_iterations)终止。这是句法级急停开关:对答案是否仍在改进视而不见——因此在简单输入上过度花费token——在困难输入上截断。我们研究语义早停:当连续草稿嵌入在意义上停止变化(带耐心窗口的余弦距离)且答案的测量质量停止改进时——循环停止。我们的工作有三个贡献。第一——诚实的理论立足:我们证明确定性终止与良定义并机器检验这些主张——同时把距离序列的收敛当作经实证检验的猜想——而非(先前被过度声称的)Banach压缩。第二——裁判高效的评估协议:每题生成一次完整轨迹——在相同草稿上回放每个停止策略——并缓存每次LLM裁判调用——以低成本得到严格配对的效率-质量比较;我们进一步把运行token(记到策略头上)与评估token(测量仪器)分离。第三——多跳检索增强问答(HotpotQA)上的实证研究。在60题测试划分上——无裁判语义停止器在同等质量下较max_iterations减少38%运行token(Delta-IS=-0.004,p=0.81)——而完整质量门控变体适得其反——因其逐轮裁判主导成本。选择最佳轮次的神谕较每个实用策略高+0.115信息分(p≈4e-11)——把问题从“何时停”(容易)重新框定为“哪轮最好”(开放)。
