协调一次,随时编写:信任分层图书馆员和多代理编写器,用于无漂移、时间点研究
Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research
摘要
大语言模型 生成的长篇研究报告会漂移、自相矛盾,并失去出处:相同的指标以不同的值出现,谣言的引用就像经过审计的文件一样自信。我们提出了一个两层代理系统,将维护的时间点知识库与报告编写分开。确定性的“图书馆员”将带时间戳的源摄取到信任分层本体中,将证据卡、权威指标账本和声明图分层到始终最新的事实源中,而不是原始块上的每个查询 RAG。然后,一个可移植的多智能体“编写器”运行时在任何知识截止 T 处撰写无矛盾的、基于证据的报告,仅读取 as_of <= T 的证据(无前瞻);红队的判决返回到图书管理员。我们对自行收集的 6,130 个来源的公共语料库进行了评估,生成了 555,926 个证据卡(涉及 295 个发行人和 11 个部门的 SEC EDGAR 文件、美国劳工统计局发布的信息和维基百科)。从一个库中,我们就不同的论文撰写了四份时间点报告,并运行了八项可重复的实验,其主要指标来自确定性的质量控制门,其本身通过召回率 1.0 和精度 1.0 的缺陷注入元评估进行验证。共享度量分类账将 6,845 个横截面矛盾消除为零。在 22/22 标准参考案例中,第一级选择是正确的,而受欢迎度第一基线得分仅为 9/22;信任分层泄露的媒体来源数据为零,并且没有任何政府统计数据可以取代公司自己的备案。红队反驳会传播回来,并在以后的运行中进行自我更正,并且零手动编辑。重播在七个截止点上显示出零前瞻违规,而库中的卡片从 235,373 张增加到 555,312 张。难度分层模型路由超过了全 Opus 质量上限,同时运行速度比串行快 3.7 倍。