论文

正确答案,错误热量:红外图像上 MLLM 的解释感知评估和热证据反馈

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

模型评测评测方法与指标

摘要

通用多模态大语言模型越来越多地用于红外图像,但通常仅按答案准确率评估。回答正确并不保证解释使用了红外热信息。本文提出解释感知评估框架,分别衡量答案正确性、输出解释是否有依据,以及是否与热信息一致。双LLM共识评判结合初步人工参考校准发现,正确回答也可能依赖较弱证据或可见光证据;隐藏原始红外图像、仅显示类似可见光的渲染图时,热信息依据明显减弱,准确率却变化很小。较强模型的这一现象更明显,而仍提供红外图像时该退化消失。无需训练的热证据反馈TGF诊断解释中的问题,在保持选定答案的同时修订解释。局部配对输入验证显示,TGF可在不改变答案的情况下改善解释的依据一致性。结果表明,红外场景模型的评价与开发需要关注解释是否有热证据支持,而不能只看答案正确。