论文
相同的公式,不同的语义:语言模型是否遵循模态逻辑规范?
Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?
摘要
关于必要性和可能性的推理取决于关于世界之间的可访问性以及每个世界中存在哪些对象的假设。因此,相同的推论可能在一种模态系统下成立,而在另一种模态系统下则失败。评估此类问题的语言模型需要测试它们的判断是否遵循规定的语义而不是熟悉的逻辑。我们构建具有相同前提和猜想但不同框架或领域条件的配对模态问题;自动推理验证相反的标签。平衡的核心可以防止语义条件单独揭示答案。在这个核心上,最近五个模型中有四个在直接提示下的表现低于仅条件基线。然而,在提示不变的情况下,启用推理模式可将 DeepSeek V4 Flash 从 4.4% 提高到 88.1%。因此,遵循规定的模态语义在很大程度上取决于推理模式以及模型身份。当省略框架条件时,模型通常会一致,但最适合不同的熟悉逻辑。我们发布公式、预言工件、反模型和响应。