论文
FregeLogic 在 SemEval 2026 任务 11:用于内容鲁棒三段论有效性预测的混合神经符号架构
FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction
摘要
我们提出了 FregeLogic,这是 SemEval-2026 任务 11(子任务 1)的混合神经符号系统,它解决了三段论有效性预测,同时减少了内容对预测的影响。我们的方法结合了五个 LLM 分类器的集合,涵盖三个开放权重模型(Llama 4 Maverick、Llama 4 Scout 和 Qwen3-32B),搭配不同的提示策略,以及用作形式逻辑决胜局的 Z3 SMT 求解器。中心假设是,整体中的 LLM 分歧可能表明存在内容偏见的错误,其中现实世界的可信度干扰了逻辑判断。通过遵循 Z3 对这些有争议案例的基于结构的形式验证,我们的系统达到了 94.3% 的准确率,内容效应为 2.85,在数据集上的嵌套 5 折交叉验证中综合得分为 41.88(N=960)。这意味着与纯集成 (39.12) 相比,综合得分提高了 2.76 分,准确率提高了 0.9%,内容效应降低了 16%(3.39 至 2.85)。采用结构化输出 API 调用进行 Z3 提取将失败率从约 22% 降低到接近于零,并且针对任务注释验证了具有存在公理的亚里士多德编码。我们的结果表明,有针对性的神经符号整合,在整体共识最低的地方精确地应用形式方法,可以提高该任务使用的组合准确性加内容效应指标。