论文

迭代LLM智能体循环的语义早停

Semantic Early-Stopping for Iterative LLM Agent Loops

智能体系统Agent 架构与控制循环Agent Harness

摘要

多智能体大语言模型(LLM)循环——例如起草的Writer与修订的Critic——几乎总以固定迭代上限(max_iterations)终止。这是句法级急停开关:对答案是否仍在改进视而不见——因此在简单输入上过度花费token——在困难输入上截断。我们研究语义早停:当连续草稿嵌入在意义上停止变化(带耐心窗口的余弦距离)且答案的测量质量停止改进时——循环停止。我们的工作有三个贡献。第一——诚实的理论立足:我们证明确定性终止与良定义并机器检验这些主张——同时把距离序列的收敛当作经实证检验的猜想——而非(先前被过度声称的)Banach压缩。第二——裁判高效的评估协议:每题生成一次完整轨迹——在相同草稿上回放每个停止策略——并缓存每次LLM裁判调用——以低成本得到严格配对的效率-质量比较;我们进一步把运行token(记到策略头上)与评估token(测量仪器)分离。第三——多跳检索增强问答(HotpotQA)上的实证研究。在60题测试划分上——无裁判语义停止器在同等质量下较max_iterations减少38%运行token(Delta-IS=-0.004,p=0.81)——而完整质量门控变体适得其反——因其逐轮裁判主导成本。选择最佳轮次的神谕较每个实用策略高+0.115信息分(p≈4e-11)——把问题从“何时停”(容易)重新框定为“哪轮最好”(开放)。

迭代LLM智能体循环的语义早停:论文配图
图 3:效率-质量帕累托(发展分裂)。质量与回合数的关系很弱;神谕远远高于一切实际政策,而完整的小水电则占主导地位。左上角最好。