TASR:无需训练 迭代检索的自适应停止
TASR: Training-Free Adaptive Stopping for Iterative Retrieval
摘要
迭代检索增强生成代理通常会在模型收敛到答案后继续检索而导致超支,从而产生既不改变预测也不改变支持证据的调用。现有的补救措施从标记的轨迹中学习停止策略,将决策与需要对每个新模型或任务进行重新训练的经过训练的组件联系起来。我们提出 TASR(无需训练 自适应停止规则),这是一种单行谓词,当模型重复其上一轮标准化答案并且等渗校准的 logits 裕度超过 0.25 时,就会触发该谓词。没有学习分类器或值头;我们评估的所有 32 种(模型、检索器、语料库)配置的阈值都是固定的。在 3 模型 x 2 数据集干扰网格上,TASR 在 62.6% 的调用中保留了固定 k=5 的宏 F1 的 94.8%,并且超出了固定 k=3 +3.42 F1。该模式适用于 9 个开放域 BM25 细胞(2.98 调用时为 55.01 F1,固定 k=3 时为 3.00 时为 54.33),并且通过干扰器分裂锁定校准,适用于两个 检索器 系列的 9 个密集检索细胞,以及 Nemotron-3-Ultra-550B 生产模型的 8 个细胞,在任何扩展中均具有零显着回归。该规则是从规范选择单元上的 381 条候选停止规则的详尽枚举中选出的,其中没有替代帕累托支配它。信号质量分析显示,在 RLHF 调整模型上,语言化 1-5 置信度崩溃(96.5% 的值等于 5,熵 0.182 nat),而 logits 裕度实现了 40 倍更好的类条件分离,使设计基于可测量的模型病理学。 TASR 是可审核的 无需训练 Pareto 基线,用于迭代检索中的自适应停止。代码可在 https://github.com/JSBAICenter/TASR 上公开获取