论文
Words & Weights:通过协同适配精简多轮交互
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
摘要
面向多轮交互的测试时策略适配(T2PAM)对于在推理阶段使大语言模型(LLM)对齐动态用户需求至关重要。然而,现有范式通常把测试时适配当作单轴问题,要么只精炼指令(Prompt Engineering),要么只调整权重(Test-Time Training),忽视了交互失败源于歧义与能力不足的耦合混合。我们主张这两条优化路径不只是相加而是协同:语义清晰度是有效参数更新的前置条件。为此,我们提出 ROSA2,一个把交互重新表述为在 Words 与 Weights 异构空间上的联合优化问题的框架。通过数学分解误差信号,ROSA2 利用文本梯度纠正意图歧义,并利用参数更新弥合能力差距。在理论上,我们证明这种协同适配严格减少收敛所需的参数位移。在实证上,ROSA2 在 MATH 上超出最先进基线 30%,同时将交互轮数减少 40%,表明精炼上下文能释放参数更新的真正潜力。
