论文

CITECHOICE:对文档呈现如何在代理检索中重新分配引文信用的因果审计

CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search

模型评测模型行为与机制分析

摘要

当多个检索到的来源支持相同的主张时,答案引擎会引用一些来源,但不会引用其他来源。我们将此决策称为引用分配,并引入 CITECHOICE,这是一种对真实多轮代理搜索的因果审计。从 129 个日常查询记录中,CITECHOICE 选择 113 个相同调用文档对,这些文档对具有独立验证的对相同预先指定事实的支持,而不观察排名或答案结果;盲人审查证实了 103。它运行一个经过哈希验证的 2×2 重播交叉对顺序,并联合生成、经过保真度检查的一个目标的结构化和散文渲染,而转录本的其余部分保持固定。出现了三个结果。首先,也是最重要的一点,结构化渲染集中了引文信用,而不是明显增加来源许可。它将每个答案的目标引用计数提高了 +0.50 次引用(95% CI [+0.20, +0.84];Holm 调整 p=.033),而不会增加总引用或减少竞争对手的信用。预先指定的发生率效应(无论目标是否被引用)为 +4.5 个百分点且不确定(95% CI [-1.4, +10.4];p=.168)。其次,观察到的位置差异超过了受控的重新排序效应:排名 1 和排名 5 之间的引用率差距为 42.3 个百分点,而主重播中的引用率差距为 +7.9 个百分点,而保留的则为 0.0 个百分点。第三,引文评估具有可测量的本底噪声。尽管在 30 个冻结家庭的新鲜解码下聚合计数效应会重复,但 15% 的二元决策发生变化,并且解码估计占单代家庭效应方差的 45%。总之,这些发现隔离了那些在控制中幸存下来的东西:呈现可以因果地重新分配冻结转录本中可见的引用信用。他们没有建立可靠的来源准入、纯粹的格式化机制或总体排名优势。