论文
Recipe-Matching:检索基准分数可能奖励数据生成配方
Recipe-Matching, Not Equivalence
摘要
MathNet-Retrieve要求检索器为数学问题找到陈述同一问题的文档。LLM在一个固定提示下生成金标文档和近似干扰项,再由LLM评审过滤。我们把这一流程称为“配方”,把用同样方式构建的数据对训练称为“配方匹配”,并考察它能在基准所声称测试的能力之外带来多少分数。同一底座的两个模型在数据行数和设置上匹配,只在训练文件上不同:一个使用另一供应商LLM与评审按照基准公布提示生成的数据对,另一个使用计算机代数验证、完全没有LLM参与的数据对。前者在简单层级的R@1领先45个百分点。非LLM释义对照表明,其中一半至三分之二来自数据对由LLM生成这一事实:在两个无关提示下进行LLM改写,采用验证模型的负例,可分别恢复30和22个点;采用同样负例的回译几乎没有效果。剩余15至25个点只在基准自己的提示下出现,在没有生成器参与的真实重复题、即两种语言中的同一问题上消失。困难层级奖励配方的数据对结构,即深度改写与最小编辑近似题的组合:仅LLM改写得零分,加入负例才解锁表现,而每种能解锁的负例都损失跨语言得分;在该层级最高分的数据集,对非LLM近似题的区分能力还低于采用验证负例的LLM改写。MELD也会随匹配其构建方法的数据训练而提高,且未损失保留能力;在SABER-Math上,预注册攻击失败,唯一来自LLM摘要的收益虽小,却在匹配预算下保持。只有在MathNet-Retrieve中,我们能把“基准得分上升、真实保留下降”的倒置明确归因于一次训练文件编辑。我们发布无生成器的重复题评测、近似题测试和三个训练模型。