论文
有用性之咒:基于DistractionIF的干扰指令鲁棒性逆缩放定律
The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF
摘要
大语言模型(LLM)越来越多地被部署在智能体和检索增强生成(RAG)系统中,在这些系统中,它们必须基于外部提供的参考文本来执行用户指定的任务。在实践中,这类上下文往往是非结构化的,并被良性但类似指令的语义噪声(如编辑批注和系统痕迹)所污染,而这些噪声应当被严格视为数据。我们提出DistractionIF,一个旨在评估对参考文本中此类干扰指令鲁棒性的基准。在广泛的模型范围内,我们观察到一致的逆缩放现象:更大的模型往往更不鲁棒,随着规模增大,性能最多下降30分。在机制层面,我们的困惑度分析揭示,缩放侵蚀了鲁棒行为与分心行为之间的概率边界,使模型越来越容易把噪声过度解读为指令。为解决这一问题,我们证明强化学习,特别是组相对策略优化(GRPO),能够恢复这一边界,在不损害通用指令遵循能力的前提下将鲁棒性最多提升15.5%。我们的发现凸显了基于参考的任务中一个关键的指令遵循鲁棒性缺口,并确立强化学习是在大规模场景下强制执行严格的数据-指令分离的一条有前景的路径。
