论文

VisualNoiseQA:带噪视觉证据下的主动推理

How Well Do LLMs Reason with Noisy Evidence? An Active Visual Reasoning Benchmark

智能体系统Agent任务评测

摘要

现实世界的推理很少会简化为静态问答:智能体必须主动从通常有噪音且不可靠的工具和传感器收集信息。然而,大多数现有的主动推理基准假设环境反馈是值得信赖的,或者在没有暴露明确的、经过校准的不确定性信号的情况下引入噪声,从而在证据本身不确定时 LLM 应该如何推理。我们引入了 VisualNoiseQA,这是一种在嘈杂的视觉反馈下进行主动推理的新颖基准。纯文本 LLM 必须通过迭代查询固定的、现成的 VLM(被视为随机视觉传感器)来解决 VQA 问题。对于每个查询,我们抽取多个样本并通过 自一致性 暴露经验不确定性信号,使推理器能够从不同角度进行 探针 并决定下一步要问什么以及何时停止。我们的构建是自动且可扩展的:从不同的 VQA 源和两个嘈杂的 VLM 开始,我们只保留传感器不一致但人类可解决的问题。我们在 1,000 个实例上评估多个 LLM 推理器,涵盖感知、图表理解和知识密集型推理。因此,VisualNoiseQA 提供了一个受控的平台来研究不同的 LLM 如何利用不确定性信号进行稳健推理。

VisualNoiseQA:带噪视觉证据下的主动推理:论文原图
图 1:嘈杂的视觉反馈下的主动推理。从 3/5 的主张“女人落后于男人”开始,强推理者会多样化其查询,发现“手挽手”矛盾,并推迟承诺,而弱推理者会提出确认性问题并承诺高度一致(4/5)但错误的答案。 VisualNoiseQA 测试 LLM 是否可以 探针,检测矛盾,并在不可靠证据下进行推理。