论文
反事实敏感性不可修复:审核视频证据的重放探针
Counterfactual Sensitivity Is Not Repairability: Auditing Replay Probes for Video Evidence
摘要
使用工具的视频代理在回答之前检索视觉证据,但最终答案并不强制取决于检索到的内容。自然的黑盒测试是反事实的:破坏代理检索到的帧的语义内容,并检查答案是否改变,对照在这些相同帧上重新执行相同管道的匹配假冒。我们引入了 CARVE,一种黑盒反事实探针,可以比较匹配的 SHAM 和 DESTROY 重放下的答案变化。在冻结的 VideoExplorer 式代理上运行三个独立的 k=3 时,DESTROY 比 SHAM 更频繁地更改答案 29.3 个百分点,从而产生巨大且可重复的聚合效应。问题级别的分数不太稳定,并且将重放预算从 k=3 增加到 k=10 减少了联系,但削弱了原始的零阈值路由策略。在 k=3 时,CARVE 从 1,258 个 LVBench 问题中选择了 538 个,并将准确性提高了 3.26 个点,回退率比大多数匹配的随机子集更高。该分数仅显示与注释的时间覆盖范围的弱关联,因此 CARVE 最好理解为路由信号而不是直接视频证据对应关系分类器。我们的实施可在 https://github.com/KurbanIntelligenceLab/CARVE 上找到。