论文
MixRea:大语言模型 中的显式-隐式推理基准测试
MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
摘要
大语言模型 (LLM) 越来越多地融入高风险决策中。受人类认知中\emph{不注意失明}理论的启发,我们研究了在嵌入注意力偏差的人类偏好语料库上训练的LLM是否表现出类似的局限性:\emph{未能在明确的任务指令下关注微妙但重要的上下文线索}。为了评估这一点,我们引入了 \textbf{显式-隐式推理} 任务,并提出 \textbf{MixRea},这是跨 9 种推理类型的 2,246 个多项选择问题的基准,具有不同的显式和隐式信息分布。对 21 个高级 LLM 的评估表明,即使是性能最好的推理模型(Gemini 2.5 Pro)也只能达到 42.8% 的一致性,揭示了普遍存在的不注意盲区。为了缓解这个问题,我们提出了 \textbf{潜在关系完成提示(PRCP)},这是一种通过恢复被忽视的因果关系来改进推理的提示方法。进一步的分析表明,这种限制在不同的多源推理任务中仍然存在,突出表明需要更加认知一致的模型。