论文

单轮向量 RAG 与 LLM 编译的 Wiki:小型多领域研究语料库的预注册比较

Single-Round Vector RAG vs an LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research Corpus

模型评测评测方法与指标

摘要

我们预先注册了两种帮助 LLM 在小型研究语料库上回答问题的方法的比较:单轮 Vector RAG 和由工具使用代理浏览的 LLM 编译的 Markdown wiki。两人使用相同的答案模型回答了 24 篇论文中相同的 13 个问题,并由两位盲法 LLM 评委评分。三个预先登记的预测结果,一项弱支持,一项支持,一项反驳。维基百科在连接论文之间的发现方面得分要高得多,但一旦两位评委合并,它的组织优势就会低于注册阈值。 RAG 满足了单事实基础的注册测试,但结果对判断敏感。该 wiki 的构建成本较低,但每次查询花费的 LLM 词元大约多出 21 倍,因此不存在盈亏平衡点。探索性分析涉及为什么这种比较不一致。 RAG 的分解检索变体以较低的词元成本缩小了 wiki 的大部分综合分数差距。评委们在整体基础性(rho = 0.04)方面的排名一致性接近于零,而在最具体定义的标准上,rho = 0.81。针对 100 个声明的两名人工注释者检查了引文支持的事后声明级别分析。第一次运行时,计分员同意他们的说法,比例为 50% 到 54%,纠正截断错误后,比例为 65% 到 69%,这与事先确定的规则不同。在注释者的标签上,分析并未为 wiki 建立引文支持优势。在一个模型和一个小型语料库上,哪个系统似乎获胜取决于检索基线、评分方法和法官,因此评估应分别报告综合、引文支持和成本,并根据人类标签检查自动证据核验评分器。