论文

SAAG:结构化智能体评估与落地

SAAG: Structured Agent Assessment and Grounding

模型评测评测方法与指标

摘要

对智能体(工具)调用的精确匹配评估掩盖了性质不同的失败模式:模型可能选对了函数却在参数值上幻觉,或满足模式却因错误理由选择工具。现有基准把这些区别压缩为单一二元分数,使从业者无法诊断智能体调用在哪里失败。我们提出SAAG,一个级联诊断框架:把智能体调用评估分解为三个顺序阶段——注册表符合性、结构完整性与参数落地——每个阶段产出可解释的阶段专属诊断。这些诊断还支持迭代自修复:预测失败时,阶段专属信号引导定向纠正而不泄露真值。我们在由Glaive函数调用数据集衍生的受控基准上评估该框架:注册表规模5、10、15个智能体,使用三个本地4B以下参数模型。结构化反馈相对单次推理与无信息的二元反馈,持续改善参数精确率并减少值幻觉;而端到端F1增益温和且依赖模型。这些结果表明,阶段分解的诊断评估是理解与改进跨模型家族、跨注册表规模的智能体调用可靠性的必要透镜。

SAAG:结构化智能体评估与落地:论文配图
图 2:三个模型在单通道、二进制反馈和结构化反馈条件下跨注册表深度 (d = 5、10、15) 的求解率 (%)。 Ministral 3 在所有设置中始终领先,而 LLaMA 3.2 随着深度的增加而退化最严重。随着注册表规模的扩大,结构化反馈可提供最大的收益和最稳定的性能。