商业税:多跳检索基准中的租金与自有盲点
The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks
摘要
企业通过检索将语言模型与自己的数据连接起来。对多跳检索系统进行排名的基准忽略了购买者在使用公布的数字之前需要的两个事实:检索主干是否可以商业部署,以及构建成本是多少。关于许可:该领域的密集检索锚点 NV-Embed-v2 已获得 cc-by-nc-4.0 许可。在我们审核的四个领先的 MuSiQue 系统(HippoRAG-2、PropRAG、SAG、KET-RAG)中,三个系统依靠它来获得最佳数据,但没有一个系统这么说。关于性能:我们在一个相同的 MuSiQue Harness上测量了来自 8 个制造商的 13 个嵌入器,并始终采用自举置信区间。直到 2026 年中期,才存在真正的商业税:最好的商业许可嵌入器落后于锚点 2.31 Recall@5 个点(95% CI [0.91, 3.71],p=0.001)。 NVIDIA 于 2026 年 7 月 16 日发布的 Nemotron-3-Embed-8B 已将其关闭:Recall@5 时为 +0.24(95% CI [-0.94, +1.43],p=0.69),Recall@10 时为 -0.58(p=0.28)。匹配主播,不打败主播,是唯一获得商业授权、免费自托管、与主播无区别的参赛者;满足前两个条件的所有其他参赛者的得分都低 5.2 至 14.6 分。持久的发现是付费与免费的分歧:API 嵌入器在每次重新索引时按词元收费,而自托管的则不收取任何费用。关于成本:五个经过审计的系统中的三个(加上微软的 GraphRAG)没有披露索引成本,并且唯一发布的 GraphRAG 美元数据在一篇第三方论文中跨越了 11 倍(对 5.64 MB 语料库进行一次索引需要 2.30 美元 vs 24.94 美元);推算到 1 TB,未公开的选择大约花费 42.8 万美元到 460 万美元。我们的成本模型将一次性嵌入与重复回答分开:在 1 TB 的情况下,嵌入的成本比图构建低 7.5 倍至 900 倍,而一年以每天 10,000 个查询的速度回答则低 350 倍或更多。