论文
学习失败的原因:对抗性数据管理的失败模式上下文强盗
Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation
摘要
我们引入了一种故障感知的对抗性检索增强框架,以提高自然语言理解的鲁棒性。我们的方法不是选择具有固定奖励阈值的合成示例,而是将对抗性数据管理制定为失败模式上下文强盗问题。候选示例是通过检索增强提示生成的,由当前目标模型过滤,由 LLM 判断整体自动验证,并聚类为重复出现的故障模式。然后,随机策略选择对哪些故障模式进行采样以进行再训练,并使用基于验证的奖励进行更新,以平衡鲁棒性增益、遗忘和数据成本。这使得数据管理器本身成为学习代理,从而能够在训练轮次中自适应选择最有用的模型故障。在标准基准测试中,我们的方法将 SNLI 上 RoBERTa 的准确率从 88.48% 提高到 92.60%,ANLI 上从 75.04% 提高到 80.95%,MultiNLI 上从 54.67% 提高到 71.99%,同时始终优于之前的对抗性增强方法。我们进一步演示了转移到 FEVER 事实验证,使用 RoBERTa-large 实现了高达 79.86% FEVER 分数和 82.45% 准确率。最后,我们提供了一个理论解释,表明在规定的假设下,故障模式采样可以减少捷径对齐的梯度贡献,同时引起有界分布漂移。通过结合检索、自动验证、上下文强盗失败选择和受控对抗性再训练,我们的框架无需额外的人工注释即可实现可扩展的鲁棒性改进。