论文

BOHM:面向复合AI系统的零成本层级归因

BOHM: Zero-Cost Hierarchical Attribution for Compound AI Systems

模型评测评测方法与指标

摘要

复合AI系统通过专门化组件的层级结构来路由任务。归因目前由基于Shapley的方法(SHAP)主导,这类方法将联盟价值函数分解为各组件的边际贡献,并要求系统可在任意组件子集上被评估。这一要求对第三方API、不透明端点以及将路由集中于少数工具的智能体编排器并不成立,导致大多数联盟从已部署的编排器出发无法评估。我们提出BOHM,它直接从此类系统已维护的路由权重中提取层级归因树:叶节点归因是根到叶路由权重的路径乘积;第k层归因是深度k节点上的诱导分布。该方法边际成本为零,无需访问组件内部,并能同时在每一层提供多分辨率归因——这是平面方法在任何评估预算下都无法提供的。BOHM与SHAP回答的是不同的问题,当部署的路由器接近最优路由时二者趋于一致。在880道LiveCodeBench题目上的3层18模型层级结构中,BOHM取得Kendall tau=0.928;SHAP达到tau=0.980,但每个种子需要多9000倍的联盟评估。在一项5驱动器、7基准的智能体研究(35个单元,完全覆盖)中,驱动器将路由集中于单一工具(最高占比中位数0.65),且单元级tau(BOHM,SHAP)可由驱动器的首选是否为经验上最佳工具预测(平均+0.22对比约+0.01)。在一个美国人口普查层级结构(475个叶节点,4层)上,BOHM在每一层都恢复了真实排名(tau最高0.722)。BOHM满足效率、单调性、对称性与弱抑制性,但不满足Shapley的可加性。最好将其理解为一种互补原语:一种只要存在路由状态就可计算的多分辨率分解,它与Shapley的分歧本身即是诊断信号。

BOHM:面向复合AI系统的零成本层级归因:论文配图
图 9:五个编码基准的领域条件归因。顶行:BCB、LCB 和 CC 的每个模型归因(条形)与真实通过率(线形)。中左:Kendall τ\tau 跨域比较。右中:显示专业化模式的按领域模型排名热图。底部:每个模型的专业化指数(跨领域的排名范围)。