论文
了解规则、应用规则:评估中国传统八字的语言模型
Knowing the Rules, Applying the Rules: Evaluating Language Models on Traditional Chinese Bazi
摘要
了解领域规则并不能保证将它们应用到案例中。我们通过涵盖 14 个理论和 11 个案例类别的 3,000 个中文多项选择题来研究传统中文八字中的这种区别。评估了六个端点系统,并报告了 2,492 项模型信息细化的主要结果。每个系统的理论准确性均超过案例准确性,排除无效响应后,仍存在 16.60-29.56 个百分点的差距。这种对比比一般的案例推理缺陷更为具体。在六个系统中,十二阶段和纳音的平均准确率达到 89.10% 和 88.62%,而神煞基础达到 75.96%。案例中,幸运柱平均为84.62%,但事业和家庭关系平均只有36.98%和38.19%。总体排名也掩盖了不同类别的优势。在原始 3,000 个项目中,配对 DeepSeek 原生/禁用比较将原生配置与 Flash 和 Pro 的理论收益分别提高了 6.53 点和 12.20 点;案例变化为 -3.67 和 +1.27 点。这些是提供者配置关联,而不是推理的孤立因果效应。结果激发了对文化领域应用程序的特定任务评估,而不是依赖于总体知识分数。该基准衡量的是与模型生成、模型验证的答案的一致性,而不是现实世界的预测有效性。最终结果是选择后的描述,不完整的出处和专家验证限制了它们的解释。