论文

在重复的 LLM 查询下衡量品牌和来源发现:有限样本审核

Measuring Brand and Source Discovery under Repeated LLM Queries: A Finite-Sample Audit

模型评测评测方法与指标

摘要

重复查询审核必须区分收集集的恢复和可能输出的完整性。我们将基于样本的稀疏化应用于来自 50 个购买问题、六种配置和每个单元 15 次调用的 4,500 个响应。观察到的 15 次调用集的历史字典中值 10 次调用恢复范围为 92.6% 至 95.2%;重新判定所有 45,683 个候选字符串会将该范围更改为 89.5%-94.7%。两个双盲 Gemini 3.1 Pro 注释角色评估了 600 个完整答案,规范名称一致性的微观 F1 为 0.908,跨度重叠一致性的微观 F1 为 0.975。这是基于人工智能的证据,没有人类参考研究。对每波 3,750 条记录进行的单独匹配名册分析得出,观察到的五次呼叫集的单次呼叫恢复中位数在 2 月份为 80.0%-92.5%,在 9 月份为 90.0%-100.0%,并且具有问题子集依赖性。当 API 返回的主机仅限于答案引用标记引用的主机时,源积累也会发生变化。这些发现表明,恢复百分比取决于提取、问题选择和有限的参考集合。它们支持明确的测量定义和敏感性分析,而无需建立详尽的清单、因果检索效应或通用停止规则。