论文
当智能体过早下注:诊断LLM智能体中的过早承诺
When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents
摘要
长程LLM智能体会安静地失败:它们早早固定对证据的一种解读——然后在整个运行中为它辩护。我们称之为过早承诺。最终答案评分错过该失败模式——因为它只看答案——不看过程是否已坍缩到稳定路径。我们定义表征承诺为固定推理步上的跨运行隐藏态收敛——并将其用作轨迹一致性的早期诊断。在Llama-3.1-70B于HotpotQA上运行ReAct时——第4步隐藏态相似度预测下游行为一致性(r=-0.35、偏相关r=-0.45)——具有局域化的时间与逐层签名。该信号在Qwen-2.5-72B与Phi-3-14B上复现——并在StrategyQA上(r=-0.83)。它不追踪正确性:承诺错误与承诺正确的问题在激活相似度上不可分。该边界是主张的核心:承诺告诉我们智能体是否已定型——而非它是否正确。运行时监视器从隐藏状态检测不一致轨迹——AUROC最高0.97(更严格划分下0.85-0.88);提示干预相对token匹配对照削减28%行为方差——而准确率统计不变。我们还测试该信号能否为自一致性计算路由;在更难基准上它仅有适度帮助——并被更简单的基于输出的基线匹敌。结果是一个针对隐藏过程失败的诊断——边界清晰而非通用准确率杠杆。
