论文
通过强化学习激励 VLM 中基于神经符号语言的推理
Incentivizing Neuro-symbolic Language-based Reasoning in VLMs via Reinforcement Learning
摘要
世界上有 7,407 种语言。但是,世界上不存在的语言又如何呢?人类的心胸是否如此狭隘以至于我们不关心外星人交流的语言?外星人也是人类啊!在 2016 年电影《降临》中,艾米·亚当斯饰演一位语言学家路易丝·班克斯博士,她通过学习用由非连续句子组成的外星语言(七肢桶)进行思考,获得了超越时间、展望未来的能力。在这项工作中,我的目标是探索视觉语言概念在神经符号语言中的表示和推理,并研究“思维系统”的分析推理能力和效率的提高。使用 Qwen3-VL-2B-Instruct 作为基础模型和 4 个 $\times$ Nvidia H200 GPU 节点,我在由数学、科学和常识问题组成的视觉语言评估数据集上实现了 3.33\% 的准确性提升,同时比 SymPy 减少了 75\% 的推理标记。我记录了所面临的计算挑战、扩展的可能性以及未来在视觉语言模型中改进神经符号语言思维的工作。训练和推理设置可以在这里找到:https://github.com/i-like-bfs-and-dfs/wolfram-reasoning。