论文
度量LLM推理质量:一个多维行为框架
Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework
摘要
大语言模型在复杂的推理任务中取得了显着的成功,但当前的评估方法主要依赖于最终答案的正确性,对产生这些答案的底层推理过程的洞察力有限。为了解决这一差距,本研究提出了一个统一的多维度框架,从行为角度衡量大语言模型的推理质量,具体化六个理论基础维度:正确性(CQ)、一致性(CS)、稳健性(RS)、逻辑连贯性(LS)、效率(ES)和稳定性(SS)。对来自四个基准的 7 个大语言模型的 975 个项目进行的广泛实验表明,该框架揭示了仅准确性指标不可见的行为。值得注意的是,逻辑连贯性与正确性正交(r = -0.172,ns),证实正确答案可以从不连贯的推理中产生,而 Claude-Haiku-4.5 获得了最高的多维分数(Q_bal = 0.778)。此外,该框架还暴露了关键的排名倒置:DeepSeek-V3 在准确性优先下排名第二,但在法律/合规权重下排名第五,这是单一指标评估无法检测到的逆转。判别有效性确认 11/15 维度对是独立的 (|r| < 0.50),为将每个维度视为不同的信号提供心理测量支持。该框架生成的维度配置文件直接支持三类部署决策:识别尽管最终答案正确(LS--CQ 正交性),其推理轨迹仍无法通过问责审计的模型;防止仅考虑准确性的基准测试造成的排名错误;并确保没有任何单一指标默默地替代框架捕获的六个独立信号。
