论文

RAG值得一个索引:为何摄取时编译胜过查询时解释

RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation

摘要

几乎所有生产中的检索增强问答系统都自带一个隐藏的解释器:每次查询时,语言模型重新推导原始语料的含义,随后把这些工作丢弃。更便宜的模型无法弥合这一差距:单token价格已下降数个数量级,而推理支出却在上升,因为上下文体积的增长快于价格的下降。这就是全表扫描的现代版本,药方则是数据库五十年前就找到的那个:把昂贵的工作在写入时做一次,做成一个让读取变便宜、且持续维护的结构。对于读取模式在遇见用户之前就已知的语料,同样可以且应当建立索引。我们将这一范式称为摄取时语义编译(ISC):把语料的含义编译为可查询的基底,包含两个耦合层——增量维护的嵌入,以及出处(provenance)在编译时即经验证的原子论断——并把该基底当作一等数据库对象,拥有自己的DDL、维护契约、迁移契约与成本模型。两个存在性证明支持该范式。其一,基底维护随变更量而非语料规模扩展:增量更新的运行成本是重构的1/33.7,同时以浮点精度追踪重构结果。其二,在500份广播访谈转录的留出样本上,以编译论断作为检索载荷在全部32个预算×模型组合中获胜:约2.2k读取token取得85.2%的正确率,而任何最佳分块配置以16.3k token仅得72.5%。唯一能跟上的是带混合检索与重排的上下文化分块流水线,其在约为21倍的查询路径token下与编译论断在统计上不可区分——我们认为它之所以达到这一持平,恰恰是因为它自身已开始编译。最后我们给出由此开启的系统议程,从编译规划器到读取规划。