论文
VisualNoiseQA:带噪视觉证据下的主动推理
How Well Do LLMs Reason with Noisy Evidence? An Active Visual Reasoning Benchmark
摘要
现实世界的推理很少会简化为静态问答:智能体必须主动从通常有噪音且不可靠的工具和传感器收集信息。然而,大多数现有的主动推理基准假设环境反馈是值得信赖的,或者在没有暴露明确的、经过校准的不确定性信号的情况下引入噪声,从而在证据本身不确定时 LLM 应该如何推理。我们引入了 VisualNoiseQA,这是一种在嘈杂的视觉反馈下进行主动推理的新颖基准。纯文本 LLM 必须通过迭代查询固定的、现成的 VLM(被视为随机视觉传感器)来解决 VQA 问题。对于每个查询,我们抽取多个样本并通过 自一致性 暴露经验不确定性信号,使推理器能够从不同角度进行 探针 并决定下一步要问什么以及何时停止。我们的构建是自动且可扩展的:从不同的 VQA 源和两个嘈杂的 VLM 开始,我们只保留传感器不一致但人类可解决的问题。我们在 1,000 个实例上评估多个 LLM 推理器,涵盖感知、图表理解和知识密集型推理。因此,VisualNoiseQA 提供了一个受控的平台来研究不同的 LLM 如何利用不确定性信号进行稳健推理。
