论文
相同数量,不同答案:语言模型中的数值表示不变性
Same Quantity, Different Answer: Numerical Representation Invariance in Language Models
摘要
无论数量是小数、分数、百分比、数字词、科学记数法还是精确转换的单位,数值等价应用题都应该产生相同的规范答案。我们生成了 3,600 个精确理性问题和 8,600 个提示,涵盖五个身份保留转换系列,并评估了五个开放权重系统。经过固定语法审核,在没有 LLM 法官的情况下标准化常见答案形式,规范精度为 0.969-0.996,但轨道正确性下降到 0.848-0.981,轨道不变性下降到 0.851-0.981;不变但错误的轨道最多占 0.003。大多数广泛的严格解析器崩溃是因为乘法形式的科学记数法位于实现的数字语法之外,这说明了评估器接口如何伪装成推理失败。明显的语义病理学仍然存在:Mistral Small 4 在单位转换输入上得分为 0.699,并产生 265 个与标签相差十倍的错误。在一项单独的 9,000 次调用实验中,将相同的调用分配给比较组,表示共识并不优于低错误子集上的释义共识,并且会产生更多的误报。随附的辅助档案包含冻结基准、评估和审计记录、共识原始响应、清单、分析代码和单命令论文构建。