论文
基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估
An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation
摘要
大语言模型把世界模型隐式编码在神经权重中,这在医疗与金融等高精度领域暴露四类结构性风险:幻觉、知识冻结、可解释性差与可修改性差。本文提出数据优先本体:LLM被视为推理与语言引擎,而确定性知识移入显式多模态数据库DaoQL。我们形式化显式世界模型并证明:在规则独立、确定性求值与固定冲突消解下,显式模型为可组合反事实可分解性提供充分条件;隐式模型缺乏原子读/增量语义,因此没有可比的架构保证。已实现的系统聚焦DaoQL经验证的存储层与显式Eval路径,在单一进程内集成图、列、向量与全文引擎。KVCache图节点、专家热更新与DaoQL-Agent运行时仍属后续工作。在同机嵌入式设置下,DaoQL报告图BFS 1.20毫秒、HNSW 83.1微秒、Fluent混合查询105.8微秒;这些结果表明工程潜力,但须结合与客户端—服务器系统的部署形态差异来解读。在LDBC SNB SF1与ANN-Benchmarks上的探索性测量进一步显示:34/34查询覆盖、交互级查询多在亚毫秒到毫秒区间,但因长尾BI/IC查询整体仅1.8 QPS;桥边保护修复后,ANN-Benchmarks在千级QPS下达到Recall@10≥99%。在五领域反事实实验(n=1250)中,DaoQL+GPT-4o取得94%的可组合反事实可分解性,比单独GPT-4o高49个百分点。论文显式区分了可证明的结构、初步经验证据与架构路线图主张。