论文

在 大语言模型 中测量几何表示的稳健性

Measuring Representation Robustness in Large Language Models for Geometry

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地根据数学推理进行评估,但它们对等效问题表示的鲁棒性仍然知之甚少。在几何中,相同的问题可以用欧几里德、坐标或向量形式表示,但现有基准报告固定格式的准确性,隐含地假设表示不变性并掩盖仅由表示变化引起的故障。我们提出了 GeoRepEval,一种表征感知评估框架,它结合严格的答案匹配、引导置信区间、配对 McNemar 测试、表征翻转分析和表面复杂性回归控制,测量并行公式中问题级别的正确性、不变性和一致性。我们证明,我们的 Invariance@3 指标将准确性分解为稳健和脆弱的部分,并受到最弱表示的限制。通过对 158 个高中几何问题(474 个实例)上的 11 个 LLM 进行评估,我们发现仅由表示选择引起的准确率差距高达 14 个百分点。向量公式成为一个一致的失败点,即使在控制长度和符号复杂性之后,Invariance@3 也低至 0.044。对于高容量模型,“转换然后解决”提示干预可将向量准确度提高高达 52 个百分点,这表明失败反映了表示敏感性而不是无能力;然而,低容量模型没有表现出任何收益,这表明存在更深层次的局限性。这些结果表明,当前模型依赖于特定于表示的启发式方法,而不是抽象的几何推理。所有数据集、提示和脚本均在 https://github.com/vedjaw/GeoRepEval 发布。