论文

面向修订语料高效可靠问答的摄入时事实编译

Ingest-Time Fact Compilation for Cost-Efficient and Reliable Question Answering over Revised Corpora

上下文与知识知识获取与更新

摘要

大多数智能体问答(QA)系统在最糟糕的时刻完成一项重要的语义工作:每次有人提问的时候。当语料包含修订、草稿、撤销、删除以及权威程度不同的来源时,模型必须在每次读取时重建受治理的当前状态——然后丢弃这些工作,在下一个查询时重复。这有点像一个每次有人读取时都重建物化视图的数据库。我们提出摄入时事实编译,一种在语料数据摄入或变更时完成这项工作的架构。原始段落被改写为自包含的事实;管辖修订、删除、生效日期和来源可信度的规则只解析一次;所得状态以携带来源和修订溯源的类型化记录存储。查询时,一个廉价的模型读取编译后的记录,而不是从嘈杂的候选中重建。在一个跨五个种子的受控合成实验中,同一低成本模型在查询时重建下30次试验中仅1次产出正确的值、来源和修订,而从编译基底则在全部30次试验中正确,每次读取的平均成本低12.89倍。在较简单的修订问题上,两种架构都精确,但编译路径使用的token少21.6倍。一项独立测试发现,事实改写把冗长的美联储对话大致减半,同时保持高来源蕴含,但对简洁的维基百科散文几乎没有改变。这些结果支持一个狭窄而实用的主张:一次性解析语料状态可以让后续问答对廉价模型更便宜也更可靠。我们发布了MIT许可的开源实现和实验产物。

面向修订语料高效可靠问答的摄入时事实编译:论文配图
图 1:摄取期事实编译(S1–S4,仅需一次开销)与两条查询期读取路径(S5 与 QSR 基线),并标注了第 IV 节的实测结果。