论文

相同的证据,不同的答案:审计多式联运中的订单敏感性 大语言模型

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

多模态 大语言模型 (MLLM) 的标准基准对一个规范排序中的每个项目进行评分,并忽略与顺序无关的改组是否会改变答案,这是新兴人工智能评估指南所要求的基线可靠性属性。我们引入 Facet-Probe,这是对 18 个前沿和开放权重 MLLM 的五方面审计(选项、证据块、文档排序、图像集和混合模态排序)。贝叶斯项目响应模型将排序噪声与每个方面的偏差分开,并且相同排序控制估计观察到的翻转的解码器随机下限。我们发现,我们审计的 18 个 MLLM 中没有一个是顺序不变的:筛选的每个方面面板的平均翻转率范围为 24-50%。温度为 0 时的 Gemini 相同排序控制估计在经过验证的单元中相对于相同输入解码器本底噪声有大量排序过剩。能力可以预测,但不能消除翻转;最好的模型在 13.4% 的试验中仍然会发生翻转。在我们的 Gemini 缓解测试中,无需训练 提示更改是模态条件的,不会从文本转换为视觉推理。这些结果表明,仅即时级别的缓解不太可能提供一般顺序的稳健性,从而激励未来在训练时间和架构方法方面的工作。我们建议将交叉排序翻转率作为 MLLM 的标准报告轴。