论文

寻求并解决:日常场景中视觉线索驱动推理的 MLLM 基准测试

Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios

模型评测基准与评测资源

摘要

日常场景的特点是视觉丰富,需要多模态 大语言模型 (MLLM) 过滤噪声并识别决定性的视觉线索以进行准确推理。然而,当前的基准主要旨在评估 MLLM 预先存在的知识或感知理解,往往忽略了关键的推理能力。为了弥补这一差距,我们引入了 DailyClue,这是一个为日常场景中视觉线索驱动推理而设计的基准。我们的构建遵循两个核心原则:(1) 严格扎根于真实的日常活动,(2) 具有挑战性的查询设计,需要的不仅仅是表面感知。我们的问题不是简单的识别,而是迫使 MLLM 积极探索合适的视觉线索并利用它们进行后续推理。为此,我们整理了一个涵盖四个主要日常领域和 16 个不同子任务的综合数据集。对 MLLM 和代理模型的综合评估强调了我们的基准带来的巨大挑战。我们的分析揭示了一些重要的见解,强调视觉线索的准确识别对于稳健的推理至关重要。