论文
从推理深度到推理广度:评估《大语言模型》中的多点联想推理
From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
摘要
大语言模型(LLM)在需要越来越长和复杂的推理链的推理任务上取得了实质性进展。这种进步主要体现在推理深度上。推理广度是一种互补且相对未经检验的能力:并行探索多个语义方向,并将所得线索整合为一个连贯的答案。我们介绍 MPAR-Bench,这是一种英汉双语基准测试,通过多点关联推理来隔离推理广度。受到合作游戏 Just One 的启发,每个项目都要求一个模型从几个独立生成的、语义不同的线索中恢复隐藏的目标。我们使用多代理线索生成管道、基于嵌入的多样性过滤和人工验证构建了 1,000 个项目。只有答案空间是从公共单词列表中提取的,而每个线索集都是从头开始生成的。除了精确匹配准确性之外,我们还使用准确性、ANLS、嵌入相似性、推理跟踪验证和四种扰动来评估模型:线索屏蔽、顺序洗牌、干扰注入和多步骤线索。在评估的模型中,扰动使英语的准确度降低了 9-18 个百分点,中文的准确度降低了 5-12 个百分点。思维模式提高了标准制定的准确性,尤其是英语,但并没有始终如一地降低对扰动的敏感度。案例层面的分析还表明,扩展推理可以推翻最初正确的假设。这些结果表明,更大的推理深度并不会自动赋予强大的推理广度,并且当前的基准在很大程度上仍未覆盖推理广度。