论文

Seir\^enes:大语言模型推理中不断发展的干扰的对抗性自我博弈

Seir\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

模型训练强化学习RLVR

摘要

我们提出Seirênes,一个自博弈强化学习框架,它将情境干扰从LLM推理的一种失败模式转变为内部训练信号,用于共同进化出更具韧性的推理器。尽管可验证奖励强化学习显著提升了推理能力,模型在遭遇非理想化情境时仍可能表现脆弱:这类情境以冗余信息、离题指令或偶然相关为特征,不同于标准基准典型的干净分布。Seirênes通过参数共享的对抗自博弈循环来利用这一脆弱性。在该框架中,同一个模型被训练为既能构建貌似合理但具干扰性的情境以暴露自身推理盲点,又能通过从这些扰动中辨别本质任务、恢复核心底层逻辑来解决问题。通过让这两个相互竞争的目标彼此对抗,Seirênes迫使模型超越表层的模式匹配,将能力锚定在稳健的底层推理上。随着模型进步,这种持续交互维持了一个富有信息量的共同进化课程。在七个数学推理基准和4B到30B的模型规模上,Seirênes分别取得平均+10.2、+9.1和+7.2点的增益。此外,4B Seirênes模型生成的干扰情境使顶级闭源模型(GPT和Gemini)的准确率下降约4-5点,揭示了Seirênes发现推理模型盲点的普适能力。

Seirênes:面向LLM推理的演化干扰对抗自博弈:论文配图
图1:Seirênes:单一策略内部的军备竞赛,用进化的干扰项做对抗自博弈。