论文

检索但未排名:结构检索中的表面形式偏差,从数学到代理轨迹

Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories

模型评测鲁棒性、公平性与可信度评测

摘要

我们评估嵌入检索,其中表面形式和含义被故意分开:在一个协议下的两个不相关领域中检索共享底层结构但不共享措辞的项目,竞争数学(MathNet-Retrieve;500 个查询,117,088 个项目语料库)和体现代理轨迹(ALFWorld 衍生;118 个查询,336 个轨迹)。在数学上,失败是彻底的:对于两个生产嵌入器来说,最重伪装层的严格 Hit@1 为 0.0%(引导 95% CI [0.0, 0.0]),而正确的项目几乎总是位于前 10 名,并且在 95.2% 到 99.8% 的失败中,获胜者在词汇上与查询的相似度高于正确答案。在表面变化是偶然的轨迹中,当金子必须涉及不同的对象时,相同的模型会达到或接近超几何机会,而一旦金子必须在对象和容器上有所不同,所有三个嵌入器的机会都低于超几何机会:检索锚定在文字标记上,而不是任务结构上。词汇重新排序控制会损害数学,但有助于轨迹(缩小 26% 到 36% 的差距,CI 不包括零);它的符号揭示了基准的表面变化是对抗性的还是偶然的。 LLM 重新排序器可以弥补数学方面 5% 到 63% 的差距,以及轨迹方面 43% 到 76% 的差距;方向在三个法官之间复制(所有 21 个单元格均为阳性),但效果大小、层级概况和离群值法官随域而变化(配对差异,到处都排除零)。数学成绩集中在著名的比赛上(+19.8分,CI [+6.7,+33.2],六格之一),所以恢复的一部分是记忆。在配对的下游实验中(210 个查询,评分者的一致性为 96% 至 99%),预言机检索与对抗性不良检索无法区分(McNemar p = 0.678);求解器 69.5% 的零样本精度在很大程度上是一个截断代理(完成的答案为 97% 到 100%),没有留下任何空间。