论文

推理中隐藏的语言一致性现象 LLM

Hidden Language Consistency Phenomena in Reasoning LLMs

模型评测模型行为与机制分析

摘要

多语言推理模型通常根据它们是否得出正确答案来评估,而不是根据它们在推理和响应时是否保留预期语言来评估。这种遗漏掩盖了随着任务变得更加困难而出现的重要的多语言行为。在本文中,我们使用 PolyMath 基准在八种语言和四种难度级别上研究推理模型的任务难度、任务准确性、思维语言一致性 (TC) 和答案语言一致性 (AC)。我们发现了四个发现:(1)语言一致性表现出四种依赖于难度的行为:输出语言一致性与输入保持一致、保持不对齐、逐渐退化或突然崩溃。 (2)我们确定了语言一致性崩溃效应,其中增加难度会导致输出语言一致性突然下降,特别是在代表性较弱的语言和非拉丁文字语言中。 (3) 由于这种崩溃效应,当模型转向其内部主导语言时,在更难的难度级别上可以保持甚至提高准确性。 (4) 量化可以提高或降低输出语言的一致性,而与其对准确性的影响无关,在 ε = 1.0 的基于容差的投票下,GPTQ 和 AWQ 通常优于 AutoRound。这些结果表明,多语言能力不能仅用准确性来表征;可靠的评估应综合考虑多语言基准的任务准确性、语言一致性和任务难度。