论文
ChLogic:评估中文表达中逻辑推理的稳健性
ChLogic: Evaluating Robustness of Logical Reasoning in Chinese Expressions
摘要
大语言模型 在标准化逻辑推理基准上的表现越来越好,但这种能力在英语之外是否仍然强大尚不清楚。我们引入了 ChLogic,这是一个英汉一致的基准测试,用于测试当相同的潜在逻辑结构用英语和不同的中文表面实现表达时模型是否保留逻辑推理性能。该基准由正式逻辑模板构建而成,包含三个数据集:(i) 通用对齐集,源自 9 个模板系列的 60 个一般命题; (ii) 困难对齐集,源自 40 个困难问题; (iii) 仅限中文的集合,涵盖 15 种语言特定的现象类型。每个对齐的项目将一个英文参考表达与五个中文实现配对。 Qwen3、Ministral 和 GLM 模型的实验揭示了持续存在的英汉表现差距。从标准中文反向翻译成英语通常会提高一般对齐集的性能,但会对困难对齐集产生混合效果,其中 Qwen3-32B 和 GLM-5.1 在翻译后表现较差。这些结果表明中文表面实现、翻译伪影和模型特定行为共同影响多语言逻辑推理。总体而言,ChLogic 为多语言推理的稳健性提供了有用的压力测试。