论文

ChaosBench-Logic:混沌动力系统上的逻辑与符号推理基准

ChaosBench-Logic: A Benchmark for Logical and Symbolic Reasoning on Chaotic Dynamical Systems

模型评测上下文与知识本体基准与评测资源

摘要

大型语言模型(LLM)擅长自然语言任务,但在需要精确逻辑与符号推理的领域仍然脆弱。混沌动力系统提供了一种要求格外苛刻的测试,因为混沌是确定性的,却常被误读为随机性或复杂性。我们提出 ChaosBench-Logic,一个使用统一一阶逻辑(FOL)本体、跨 30 个多样动力系统评估 LLM 推理的基准。每个系统均标注了 11 个语义谓词的真值指派,并在七个推理类别下生成 621 道问题,包括多跳蕴含、跨系统类比、反事实推理、偏见探针与多轮对话。我们定义了逻辑准确率、蕴含一致性、对话连贯性与矛盾的度量指标,并发布开源评测流水线。初始实验显示,GPT-4、Claude 3.5 Sonnet、Gemini 2.5 Flash 与开源 LLaMA-3 70B 等前沿 LLM 取得 91%—94% 的逐题准确率,但在组合类题目上仍得 0%,且整体连贯性脆弱。对话级准确率介于 53.1%(GPT-4 CoT)与 75.5%(LLaMA-3 zero-shot)之间。ChaosBench-Logic 为诊断此类失败提供了严格的测试平台,也为发展能改进 LLM 科学推理的神经符号方法奠定了基础。