论文
批评者经验库:LLM智能体的自进化步级置信估计
Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents
摘要
LLM智能体在外部环境中行动:每个动作改变后续决策所条件化的状态,单个错误步骤可能在最终失败被观察到之前就浪费交互预算或触发不可逆副作用。可靠部署因此需要步级置信估计——在动作执行前可用的、该动作富有成效的校准概率。既有LLM置信估计器设计为从给定提示对响应打分,但智能体置信还依赖执行后果:相似情境下的相似动作在环境响应后是否真的推进了任务。我们提出批评者经验库(Critic Experience Bank):一个自进化批评者框架——LLM批评者从自身既往判断及其观察到的后果中积累证据。每条轨迹之后,一个看到完整执行反馈的事后LLM对每个步骤是否有成效投票;所得伪标签填入经验库,当相似步骤再现时把相关的高效与低效经验检索进批评者的提示。Critic Experience Bank无需训练、不使用真值步级标签。跨三个智能体基准与三个批评者底座:它在每个数据集—批评者组合中取得最佳校准(ECE与Brier)与排名(AUC),相对最强免训练基线把ECE最多降低54%。
