论文
看得见的链,看不到的答案:视频 MME 强制思维链的多方面评估方法
Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME
摘要
人们普遍认为强制思维链(CoT)可以使视觉语言模型在视频问答中更加可靠。我们提出了一个小型三探针评估方案来测试该假设:直接、CoT、答案优先和无视频条件下的配对准确性; CoT 链上的反事实视频交换诊断;和一个四级视觉退化阶梯。每个探测都在严格和宽松的正则表达式评分器下进行报告,并对手稿声明的主要家庭进行多重校正。应用于视频 MME 子集上的 Qwen2.5-VL 时,该配方返回由两部分组成的结果。 CoT 链受到强烈视频条件的影响:交换输入视频会折叠链重叠并翻转大多数最终字母,这与“样板链”空值所预测的相反。然而,在相同的数据上,强制 CoT 并不能提高 MCQ 准确性,并且在较小的 7B 模型上,它在事后主要评分者选择下产生了小幅但统计支持的下降。我们并不认为这可以推广到 Qwen2.5-VL / Video-MME 实例化之外;原始响应和单个重新计算脚本将与补充材料一起发布,以便可以重新导出每个数字。