论文

批评者经验库:LLM智能体的自进化步级置信估计

Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents

智能体系统Agent 动作执行与治理

摘要

LLM智能体在外部环境中行动:每个动作改变后续决策所条件化的状态,单个错误步骤可能在最终失败被观察到之前就浪费交互预算或触发不可逆副作用。可靠部署因此需要步级置信估计——在动作执行前可用的、该动作富有成效的校准概率。既有LLM置信估计器设计为从给定提示对响应打分,但智能体置信还依赖执行后果:相似情境下的相似动作在环境响应后是否真的推进了任务。我们提出批评者经验库(Critic Experience Bank):一个自进化批评者框架——LLM批评者从自身既往判断及其观察到的后果中积累证据。每条轨迹之后,一个看到完整执行反馈的事后LLM对每个步骤是否有成效投票;所得伪标签填入经验库,当相似步骤再现时把相关的高效与低效经验检索进批评者的提示。Critic Experience Bank无需训练、不使用真值步级标签。跨三个智能体基准与三个批评者底座:它在每个数据集—批评者组合中取得最佳校准(ECE与Brier)与排名(AUC),相对最强免训练基线把ECE最多降低54%。

批评者经验库:LLM智能体的自进化步级置信估计:论文配图
图 2:CEB 概述。在每一步中,代理都会根据任务、当前状态和交互历史记录提出一个操作 ata_{t}。在执行操作之前,冻结的 LLM 评论家使用当前上下文和从经验库检索的对比经验来估计步骤置信度 z^t\hat{z}_{t}。完整的轨迹完成后,大语言模型会根据执行反馈将每个步骤标记为有效或无效,形成附加到银行的紧凑记录。