论文

开局即败:经召回控制探针级联的LLM智能体回合早停

Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

智能体系统Agent 架构与控制循环

摘要

大语言模型(LLM)智能体常在多步轨迹注定失败时仍继续推理——浪费算力。我们用隐状态探针研究LLM智能体的早期失败预测与推理时早停:内部激活上的轻量线性探针从第一交互轮即可预测最终任务失败——远早于仅基于可观察行为的智能体监控方法。我们把该信号转为召回控制的中止级联以降低LLM智能体推理成本:级联在每个早期交互轮应用免分布校准的失败检测器,并联合优化逐轮召回预算——确保最终成功的回合在用户指定的全局召回率下幸存所有早停门。选择后级联被冻结并在独立数据上认证,提供精确的选择后召回保证。在TextCraft与WebShop上以Qwen-2.5-7B、Llama-3.2-3B与Qwen3-1.7B评估:所提早停级联在每个模型—环境对上超越最佳单门基线,在90%召回目标下节省1.5–8.8倍的算力;全部24个配置中实现的召回保持在目标一个标准差内。最强设定在90%召回下把生成token削减60.2%(TextCraft)与54.9%(WebShop),95%召回下仍保持45.0%与41.5%的节省。仅行为监控持续更弱,向隐状态探针添加行为特征无进一步增益。我们还刻画了认证高召回早停策略所需的样本复杂度。

开局即败:经召回控制探针级联的LLM智能体回合早停:论文配图
图 1:召回控制的中止级联。在第一轮 RgR_{g} 的每一轮中,线性探针 frf_{r} 读取代理的隐藏状态 hrh_{r},如果失败分数超过校准阈值 τr\tau_{r},则门会中止该事件;只有在每一个关卡中幸存下来,一个情节才算完成。阈值带有每轮无分布召回保证,并且联合搜索每轮预算 trt_{r},以便剧集级成功召回满足用户选择的目标 ρ⋆\rho^{\star};然后可以根据独立保留的数据对所选级联进行认证,从而产生精确的选择后保证。