论文

QUIVER:量化复合AI系统中扰动传播与分叉的形式化框架

QUIVER: A Formal Framework for Quantifying Perturbation Propagation and Bifurcation in Compound AI Systems

模型评测评测方法与指标

摘要

将多次LLM调用串联为有向计算图的复合AI系统已成为生产级AI的主流架构。尽管这类架构利用了具有混合模式输出的异构节点,但在节点本身是随机的、执行路径可能在结构上发生分叉的情况下,尚无现有框架量化扰动如何在这类流水线中传播。我们提出QUIVER,一个用于度量图结构LLM流水线中扰动传播的形式化框架。该框架定义了:(1)带类型分派距离度量的敏感度矩阵,可将边分类为放大器、吸收器或阈值敏感型,并以出现度提升(occurrence-lift)作为补充;(2)轨迹分歧,将变异分解为数值漂移、结构路径分歧与迭代次数分歧;(3)分叉阈值,识别导致执行路径发生结构性变化的最小扰动;(4)分布忠实度,量化各节点的评估数据集何时偏离生产分布。我们在两条生产级企业流水线和一个公开的DSPy多跳问答流水线这三种结构各异的架构上进行验证。基于8200余条插桩轨迹(32000余次两两比较),我们证明QUIVER能够揭示不同架构各自独特的敏感度画像,区分产生相同分歧率但机制不同的级联模式,仅凭观测数据即可预测易发生轨迹分叉的节点,并将陈旧评估产物定位到聚合指标无法揭示的特定节点-字段类别。

QUIVER:量化复合AI系统中扰动传播与分叉的形式化框架:论文配图
图 2:σ^\hat{\sigma} 热图,BM25 与 ColBERTv2。行:上游viv_{i};列:下游 vjv_{j}。颜色在以 σ^=1\hat{\sigma}{=}1(白色)为中心的发散尺度上对 σ^i​j\hat{\sigma}_{ij} 进行编码。灰色单元格暂时不可行(i 在 j 之后触发)或数据不足 (n⁡(di>ϵ)<30n(d_{i}{>}\epsilon){<}30)。强放大器和吸收细胞(深红色、深蓝色)在猎犬中保持稳定;只有接近统一的单元格才会改变颜色——表 8 中标记为翻转的相同三个边缘。