论文
SAAG:结构化智能体评估与落地
SAAG: Structured Agent Assessment and Grounding
摘要
对智能体(工具)调用的精确匹配评估掩盖了性质不同的失败模式:模型可能选对了函数却在参数值上幻觉,或满足模式却因错误理由选择工具。现有基准把这些区别压缩为单一二元分数,使从业者无法诊断智能体调用在哪里失败。我们提出SAAG,一个级联诊断框架:把智能体调用评估分解为三个顺序阶段——注册表符合性、结构完整性与参数落地——每个阶段产出可解释的阶段专属诊断。这些诊断还支持迭代自修复:预测失败时,阶段专属信号引导定向纠正而不泄露真值。我们在由Glaive函数调用数据集衍生的受控基准上评估该框架:注册表规模5、10、15个智能体,使用三个本地4B以下参数模型。结构化反馈相对单次推理与无信息的二元反馈,持续改善参数精确率并减少值幻觉;而端到端F1增益温和且依赖模型。这些结果表明,阶段分解的诊断评估是理解与改进跨模型家族、跨注册表规模的智能体调用可靠性的必要透镜。
