论文
数据驱动的机器学习无法达到符号级逻辑推理——缩放律的极限
Data-driven Machine Learning Cannot Reach Symbolic-level Logical Reasoning -- The Limit of the Scaling Law
摘要
通过把向量提升到球面并支持显式模型构造——神经网络无需训练数据即可执行符号级三段论推理。我们识别阻止常规数据驱动机器学习系统达成该能力的两个根本限制:由组合表生成的训练数据无法区分全部24种有效三段论类型——而端到端前提到结论映射在神经组件内制造矛盾目标。用两个代表性常规系统(使用语言输入的GPT-5与使用视觉输入的Euler Net)的实验支持该分析。ChatGPT GPT-5可能达到100%三段论推理准确率——但带幻觉。因为学习过程在达到100%准确率时终止——系统无法从经验准确率进阶到符号级推理。随机测试数据把Euler Net准确率降到56%。反复扩充训练集把其准确率提到97%——其中8种三段论类型完美。但由于非预期输入无法被穷尽覆盖——即使100%测试准确率也不意味着符号级推理。由于三段论推理是逻辑推理与人类理性的基石——这些结果提示仅增加数据与训练时间无法确保符号级逻辑推理。
