论文

当智能体过早下注:诊断LLM智能体中的过早承诺

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

模型评测模型行为与机制分析

摘要

长程LLM智能体会安静地失败:它们早早固定对证据的一种解读——然后在整个运行中为它辩护。我们称之为过早承诺。最终答案评分错过该失败模式——因为它只看答案——不看过程是否已坍缩到稳定路径。我们定义表征承诺为固定推理步上的跨运行隐藏态收敛——并将其用作轨迹一致性的早期诊断。在Llama-3.1-70B于HotpotQA上运行ReAct时——第4步隐藏态相似度预测下游行为一致性(r=-0.35、偏相关r=-0.45)——具有局域化的时间与逐层签名。该信号在Qwen-2.5-72B与Phi-3-14B上复现——并在StrategyQA上(r=-0.83)。它不追踪正确性:承诺错误与承诺正确的问题在激活相似度上不可分。该边界是主张的核心:承诺告诉我们智能体是否已定型——而非它是否正确。运行时监视器从隐藏状态检测不一致轨迹——AUROC最高0.97(更严格划分下0.85-0.88);提示干预相对token匹配对照削减28%行为方差——而准确率统计不变。我们还测试该信号能否为自一致性计算路由;在更难基准上它仅有适度帮助——并被更简单的基于输出的基线匹敌。结果是一个针对隐藏过程失败的诊断——边界清晰而非通用准确率杠杆。

当智能体过早下注:诊断LLM智能体中的过早承诺:论文配图
图 1:跨步骤和层的激活相似性与行为 CV 之间的 Pearson rr(n=99n=99;在步骤 4 中排除了一个问题,因为其所有运行均较早终止)。金色边框表示 p<0.05p<0.05。信号在第 4 步集中在第 32-80 层。