论文

顺应性与感性:论《大语言模型》中的推理可控性

Compliance vs. Sensibility: On the Reasoning Controllability in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 通过 预训练 数据中的共享推理模式获得推理能力,并通过思想链 (CoT) 进一步引出。然而,归纳、演绎、溯因等基本推理模式能否与具体问题实例解耦仍然是模型可控性的关键挑战。在本文中,我们通过推理冲突的视角首次系统地研究了该问题,推理冲突是由偏离目标任务预期的逻辑图式引起的参数信息和上下文信息之间的明显张力。我们的评估表明,LLM 始终优先考虑敏感性而非合规性,尽管指令存在冲突,但仍倾向于适合任务的推理模式。我们进一步证明,推理冲突是可以在内部检测到的,因为在冲突事件中置信度分数会下降。即使没有合规性,探测也能揭示指令的可解码性,而 CKA 则可以识别模型和跨度之间的几何差异。利用这些见解,我们引导模型走向合规性,将指令遵循率提高高达 29%。总的来说,我们的研究结果表明,虽然 LLM 推理是以具体实例为基础的,但积极的机械干预可以有效地将逻辑图式与数据解耦,从而提供一条提高可控性、忠实性 和概括性的途径。