论文

X-RAY:通过形式化校准探针绘制LLM推理能力图谱

X-RAY: Mapping LLM Reasoning Capability via Formalized and Calibrated Probes

模型评测评测方法与指标

摘要

大型语言模型(LLM)取得可观性能,但其推理能力仍知之甚少。现有评估大多强调任务级准确率,常将模式匹配与推理能力混为一谈。我们提出X-RAY,一个可解释推理分析系统,使用校准的、经形式化验证的探针来绘制LLM推理能力图谱。我们将推理能力建模为可提取结构的函数,通过约束交互、推理深度和解空间几何等形式属性来操作化。X-Ray通过形式化工具生成具有受控结构变化的探针,通过形式化校准与验证实现增量结构信息的精确隔离。我们在从初级到高级的数学、物理和化学问题上评估最先进的LLM。我们的分析揭示了LLM推理中的系统性不对称:模型对约束细化相对鲁棒——附加条件使已有解空间收缩——但在解空间重构下急剧退化——修改改变了解流形的底层结构形式。此外,校准的形式化探针能够区分在标准基准上看似无差别的模型,并揭示结构上可解释而非不透明的失败模式。除评估外,我们的框架无污染,并支持推理模型的训练与测试。

X-RAY:通过形式化校准探针绘制LLM推理能力图谱
图1:以解空间重构为示例,在邮票覆盖(stamp-coverage)探针上测得的GPT-4o与o4-mini能力。