论文
即时扰动在哪里破坏生成? LoRA 调整语言模型中稳健性的分段级视图
Where Do Prompt Perturbations Break Generation? A Segment-Level View of Robustness in LoRA-Tuned Language Models
摘要
大语言模型 对微小的提示扰动很敏感,但现有的稳健性方法通常在整个序列级别上强制执行一致性。这种整体视图可以隐藏一种重要的故障模式:受干扰的响应可能在总体上与干净的响应保持相似,同时在关键实体、关系或结论上发生漂移。我们引入了 S$^2$R$^2$,这是一个用于稳健 LoRA 微调 的段级框架。 S$^2$R$^2$ 将干净代和扰动代分解为语义片段,将它们与最佳传输目标对齐,并惩罚具有最大意义漂移的片段。为了将这个输出侧目标与模型自适应联系起来,我们添加了一个由分段级注意力重新分配驱动的适配器稳定性正则化器,使用 LoRA 范数控制作为限制扰动放大证据转移的易于处理的代理。 PAC-贝叶斯复杂性视图进一步解释了为什么控制适配器生长可能支持超出观察到的扰动的传输。摘要基准实验表明,S$^2$R$^2$ 提高了印刷噪声、删除、同义词替换和释义下的鲁棒性,同时保持了有竞争力的干净性能和比基于一致性的基线更强的跨数据集传输。