论文
超越准确性:在 LLM 中跨九个复杂度维度诊断代数推理失败
Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions
摘要
代数推理仍然是 大语言模型 信息最丰富的压力测试之一,但当前的基准测试没有提供将失败归因于特定原因的机制。当模型无法解决代数问题时,单个准确度分数无法揭示表达式是否嵌套太深、运算符太不常见、中间状态计数太高或依赖链太长。先前的工作已经单独研究了单独的故障模式,但没有框架在严格的实验控制下独立地改变每个复杂因素。现有系统还没有提供自动生成和验证日益复杂的问题来跟踪模型随时间的进展。我们引入了一个九维代数复杂性框架,其中每个因素独立变化,而所有其他因素保持固定,问题生成和验证由参数管道处理,无需人工注释。每个维度都以记录的 LLM 故障模式为基础,并捕获代数难度的结构上不同的方面,包括表达式嵌套深度、同时中间结果计数、子表达式复杂性、运算符硬度和相关推理链长度。我们评估了七个指令调整模型,涵盖所有九个维度的 8B 到 235B 参数,发现工作记忆是主要的尺度不变瓶颈。无论参数数量多少,每个模型都会崩溃 20 到 30 个并行分支,这表明存在硬架构约束,而不是可解决的容量限制。我们的分析进一步确定了五个维度的最小但诊断上足够的子集,这些维度一起跨越了记录的代数故障模式的整个空间,提供了模型代数推理能力的完整复杂性概况。