论文

Words & Weights:通过协同适配精简多轮交互

Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation

模型训练持续学习

摘要

面向多轮交互的测试时策略适配(T2PAM)对于在推理阶段使大语言模型(LLM)对齐动态用户需求至关重要。然而,现有范式通常把测试时适配当作单轴问题,要么只精炼指令(Prompt Engineering),要么只调整权重(Test-Time Training),忽视了交互失败源于歧义与能力不足的耦合混合。我们主张这两条优化路径不只是相加而是协同:语义清晰度是有效参数更新的前置条件。为此,我们提出 ROSA2,一个把交互重新表述为在 Words 与 Weights 异构空间上的联合优化问题的框架。通过数学分解误差信号,ROSA2 利用文本梯度纠正意图歧义,并利用参数更新弥合能力差距。在理论上,我们证明这种协同适配严格减少收敛所需的参数位移。在实证上,ROSA2 在 MATH 上超出最先进基线 30%,同时将交互轮数减少 40%,表明精炼上下文能释放参数更新的真正潜力。

Words & Weights:通过协同适配精简多轮交互
图1:ROSA2框架概览。我们将 T 2 PAM 表述为关于耦合变量 ϕ t = { x t + 1 , θ t } \phi_{t}=\{x_{t+1},\theta_{t}\} 的联合优化问题。在前向阶段(实线)中,模型以历史 H t − 1 H_{t-1} 为条件生成响应 y t y_{t}。反向阶段(虚线)通过两个协同模块近似交互损失 ℒ \mathcal{L} 的完整梯度 ∇ j o i n t \nabla_{joint}:文本优化(上方,绿色)利用文本梯度( ∇ x \nabla_{\mathrm{x}} )将用户反馈精炼为更清晰的指令( x t + 1 → x t + 1 ∗ x_{t+1}\rightarrow x_{t+1}^{*} ),以消解上下文歧义;参数优化(下方,蓝色)则采用梯度更新( ∇ θ \nabla_{\theta} )调整适配器权重( θ t → θ t + 1 \theta_{t}\rightarrow\theta_{t+1} ),以增强模型的内在能力。这种协同适配确保系统在下一轮中在意图上更“清晰”、在执行上更“强大”。