论文
面向可靠LLM数据分析的语义层:三个前沿模型的准确率与幻觉配对基准
Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models
摘要
用于自然语言查询分析型数据库的LLM存在两类相互交织的失效——错误答案与自信的幻觉——二者根因相同:模型被迫推断模式(schema)并未编码的业务语义。我们检验把这些语义作为上下文提供能否弥合差距。我们采用配对单轮协议,在ClickHouse的Cleaned Contoso Retail Dataset上用100个自然语言问题对三个前沿LLM(Claude Opus 4.7、Claude Sonnet 4.6、GPT-5.4)进行基准测试。每个模型评估两次:一次仅提供仓库模式,一次提供模式外加一份4 KB手写markdown文档,其中描述数据集的度量、约定与消歧规则。加入该文档使三个模型的准确率提升+17至+23个百分点。有文档时三个模型在统计上无差异(67.7-68.7%);无文档时同样无差异(45.5-50.5%)。每一项跨组比较均在 p < 0.01 水平显著。语义层文档的存在解释了几乎全部显著方差;同层内的模型选择则不然。我们将其解读为一个结构性结论:显式业务语义抑制最主要的text-to-SQL错误类别,靠的不是让模型更强大,而是改变了模型被要求做的事情。