论文

超越完成:探索累积状态跟踪以预测 LLM 代理绩效

Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance

模型评测评测方法与指标

摘要

任务完成率是 LLM 代理能力的标准指标,但具有相同完成分数的模型在跟踪中间状态的能力方面可能存在很大差异。我们引入了工作记忆保真主动操纵 (WMF-AM),这是一种累积算术状态跟踪的校准无便笺式探针,并针对已发布的确定性 10 任务代理电池在 20 个开放权重模型(0.5B-35B,13 个系列)上对其进行了评估。在预先指定的 Bonferroni 校正分析中,WMF-AM 预测代理性能,Kendall's tau = 0.612(p < 0.001,95% CI [0.360,0.814]);探索性部分 tau 分析表明,在控制完成分数和模型规模后,该信号仍然存在。三种构造隔离消融(K = 1 控制、非算术上限、轭抵消)支持这样的解释:负载下的累积状态跟踪,而不是单步算术或单独的实体跟踪,是主要困难源。 K 校准将探头保持在一个有辨别力的范围内,在此范围内先前的固定深度基准变得无辨别力;超出这个开放权重样本的概括仍然存在。

WMF-AM:通过深度参数化累积状态跟踪探测LLM工作记忆:论文配图
图 4:有效性证据热图。 CEF 探针和外部基准之间的收敛和发散相关性 (N=15N{=}15)。 WMF-AM 显示出较高的发散有效性(与完成度的相关性较低)和中等的收敛有效性(与代理电池分数相关)。