论文
数学解题中可执行推理约束下LLM的表示鲁棒性
Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving
摘要
大语言模型(LLM)日益在数学解题上被评估,但既往工作常把表示等价的表述视为可互换,并把推理错误与接口失败混为一谈。本文通过系统变化同一底层问题的表面表示——应用题、文字等式、符号等式与同构改写——研究LLM数学解题的表示鲁棒性。使用精选的数学等价问题数据集,我们在直接答案生成条件下评估五个当代LLM。我们发现实质的表示敏感性:模型在等价表述间频繁改变正确性,应用题、符号与文字等式变体间有可观的翻转率。我们还观察到同构改写下的系统性回退:即使措辞层面的细微变化也会在数学结构保持的情况下降低表现。随后我们评估代码增强条件:模型把推理外化为可执行Python代码并在本地运行验证。该接口在某些直接提示下表现不佳的模型中揭示出强潜在推理能力,但并未一致改善鲁棒性:失败在交互层间转移——从不可见的推理错误转为协议违规与执行失败;即使可执行推理成功,表示敏感性常仍存在。总体上,推理脚手架不能消除表示脆弱性,而是暴露正确性、可靠性、延迟与成本之间的新权衡。我们主张在LLM评估与部署中应把表示视为一等接口设计变量,对AI辅助解题系统尤其如此。