论文

通过代理评估和稳定性感知排名为多模式 LLM 提供稳健的检查点选择

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

模型评测评测方法与指标

摘要

当后期候选者紧密匹配且下游评估信号有噪声时,为多模态 大语言模型 (MLLM) 选择最终检查点具有挑战性。观察到的微小差异可以与有限评估样本、基于 LLM 的法官和模糊的多模态证据引入的变异性进行比较,而验证损失可能无法识别下游评估首选的检查点。我们将后期检查点选择制定为评估不确定性下的稳定性感知决策问题,并提出了一种结合点式过滤、列表式排序和成对细化的渐进式框架。重复评估集子采样用于表征排名稳定性,而基于百分位数的聚合则说明下尾和上尾行为。实验表明,多模式数据可评估性至关重要:对 OCR 大量输入进行质量意识管理可将排名翻转率从 32.5% 降低到 11.2%,并将运行间一致性从 0.61 提高到 0.84。我们进一步观察两个独立 MLLM 设置中验证损失进展和下游检查点偏好之间的差异。跨 11 个检查点的额外公开 Qwen2.5-VL-7B 再现显示紧密聚集的逐点分数和经常以平局为主的最终成对比较,而重复评估通常选择中间检查点而不是最终检查点。这些结果表明,可靠的 MLLM 检查点选择应该量化并保留评估的不确定性,而不是根据单个指标的微小差异强制做出决策。