论文
选定对象能否抵达读取端?有据语言模型流水线中的身份交接审计
Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
摘要
基于地面的语言模型管道可分为三个阶段:选择对象、为其检索段落、利用证据作答。若选定对象必须到达读者,丢失则破坏了交接。基准召回检查数据集关联的对象,二者可能不同。我们审计了600个HybridQA问题,覆盖三个选择器家族。在1,463条可解决记录中,当选定对象与数据集追踪的段落一致时,精确键查找和精确标题匹配每次都能返回该对象。在相同解码后的选定标题下,仅基于正文的BM25在截止分数为五时,有389条记录(26.6%)遗漏该对象,而混合检索结合重排序则遗漏14条(1.0%)。两个身份在1,792条可解决记录中存在差异的有329条。在原始问题排名下,其前五名结果在106条记录(5.9%)上存在分歧。固定读者对比显示,对齐对象的存在性与精确匹配提升28.6至31.0个点。在刻意选取的64项样本中,移除该段落会显著降低精确匹配率,而移除相似长度的对比段落则无法重现该下降。我们发布了返回对象概览(ROP),包含目标、返回ID字段、截止分数、成员规则及完整预期群体的可执行记录,附带数据和离线回放功能。