论文

TESTNAV:面向组合鲁棒性测试的Pareto引导搜索

TESTNAV: Pareto-Guided Search for Compositional Robustness Testing

模型评测评测方法与指标

摘要

深度学习模型在真实世界的输入扰动面前依然脆弱,尤其是当多种破坏在同一个输入中同时出现时(例如亮度偏移与运动模糊)。组合测试能够揭示这些交互效应,但带来两个挑战:随着扰动维度和严重性等级的增加,扰动空间呈组合式增长;以及诊断价值不均——许多组合产生不切实际的退化输入,现实相关性有限。我们提出 TESTNAV,一个Pareto引导的鲁棒性测试框架,用于在只能评估有限数量扰动配置的情况下高效探索离散的组合扰动空间。TESTNAV 将鲁棒性测试表述为双目标优化——最大化性能退化,同时保持由模态特定指标衡量的输入保真度(视觉用 SSIM 和 KID,语言和代码用 chrF 和 BERT-F1)——从而优先发现严重但真实的失败。它使用 NSGA-II 来逼近双目标Pareto前沿。在涵盖视觉、自然语言和代码生成的四个基准上,TESTNAV 恢复Pareto前沿的速度比基于搜索的基线最高快 2.15 倍,仅使用了由四个扰动维度、每维六个等级所定义的离散扰动空间的 35.8%–89.3%。

TESTNAV:面向组合鲁棒性测试的Pareto引导搜索:论文配图
图1:各基准与保真度指标上的𝒫*。每个面板展示完整配置空间(灰色)和帕累托前沿(青色);|𝒫*|给出每个基准-指标对的前沿规模。帕累托前沿包含有一到四个活跃扰动维度的配置。按阶1–4计的数量为:SSIM 27(9,12,4,2);KID 27(4,7,14,2);chrF 13(2,7,2,2);BERT-F1 12(2,7,1,2);chrF 20(2,3,12,3);BERT-F1 17(3,9,5,0);chrF 24(1,5,13,5);BERT-F1 30(7,12,5,6)。详见附录。