论文

推理链长如何影响LLM对答案真实性的判断

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 已被广泛采用作为人类评估的可扩展替代品,但此类判断仍然不完善且容易受到表面偏差的影响。一个可能的原因是这些法官缺乏足够的信息来评估答案的正确性。随着具有推理能力的模型的兴起,将生成器的推理内容暴露给判断者可以提供更丰富的信息,并且是提高判断准确性的自然选择。然而,它对法官行为的实际影响仍有待研究。在本文中,我们系统地研究了推理链的访问如何影响事实问答(QA)和数学推理基准中基于 LLM 的判断。我们发现,弱法官很容易受到推理存在的影响,经常接受伴随着流畅推理的错误答案,而强法官可以部分利用推理作为信息证据。然而,即使是强有力的法官也会被看似高质量的推理链所误导。对照实验进一步表明,推理链的流畅性和真实性是推动法官决策的关键信号。这些发现凸显了需要更强大的 LLM 法官,以便在评估现代推理模型时能够区分真正的推理质量和肤浅的流畅性。