论文
工具使用智能体的调用级可靠性
Invocation-Level Reliability of Tool-Using Agents
摘要
工具使用智能体以两种方式失败:选错工具,或构造错误参数,任一类型的早期失败都可能悄然破坏其后的所有结果。我们在干净教师强制上下文和模型自身自由运行上下文两种条件下,在五个开源权重模型上,对无污染多步任务(深度1–8)测量了一个将两种失败分开的正确调用率。到深度6时,模型自身干净上下文能力约有70%被其早期错误损耗(L6 = 0.686、0.684)。我们的核心发现关乎测量本身:在针对固定金轨迹的精确匹配评分下,传播模型的严重性和恢复参数不仅难以估计——它们由评分规则固定。严重性被强制到边界(869个被污染步骤中0个正确);恢复在结构上不可观测(580个被污染步骤中0个返回正轨,而按偶然的期望值为0.0058)。两者都源于同一机制:分歧发生之后,金值由模型从未见过的工具常量生成,因此是模型无法推导的信息。即便强行拟合,也会为一个精确为1.000的量返回0.92和0.73——对一个评分规则已经确定的参数给出自信的数字。我们给出机制与补救措施:条件于状态的评分(conditional-on-state scoring),可回溯性地应用于缓存的补全而零额外成本,它将严重性解除钉死,得到排除零的内部估计(+0.149、+0.316)。