论文

ChaosBench-Logic v2:大规模评估动态系统上的 LLM 逻辑推理

ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

模型评测基准与评测资源

摘要

二元推理基准的标准准确性隐藏了关键的故障模式:先前崩溃、释义不一致以及无法推理参数相关的动态。我们推出了 ChaosBench-Logic v2,这是一个包含 40,886 个问题的基准测试,涉及 165 个动态系统,具有 27 个 FOL 谓词和 78 个公理边,以及 CARE(校准和对抗鲁棒评估),这是一个揭示这些病态的协议。评估 14 个模型,我们发现即使对于前沿模型,政权转移推理仍然接近随机(MCC = 0.05),而给定前提下的 FOL 推导达到 MCC = 0.52。按系列分解显示,专有模型的优势集中在交叉指标(+0.40)和一致性任务上,而开源 Qwen 2.5-32B 主导指标诊断(0.91 vs. 0.45)。两个模型在分叉问题上表现出负 MCC,通过混淆矩阵分析证实为系统反相关。