论文
提示空间元学习不会在用户之间转移:冻结的 LLM 负面结果
Prompt-Space Meta-Learning Does Not Transfer Across Users: A Frozen-LLM Negative Result
摘要
为个人用户个性化冻结的 大语言模型 (LLM) 通常被视为提示空间中的元学习问题:每个用户都是一个任务,并且寻求一种共享的自然语言适应策略,在给定用户的少量标记交互的情况下,为该用户配置冻结模型。该框架很有吸引力,因为它与主干无关,并且重用了即时优化机制,但该领域很少测试优化的元目标是否编码可转移的跨用户适应而不是通用指令质量。我们用 Muse(通过共享进化进行元学习用户适应)来研究这个问题,它通过反射提示进化在元训练用户群上进化出一个共享的适应提示,冻结它,并将其零样本应用于保留的用户;匹配的控制将学习与措辞和选择的混乱隔离开来。在两个标准个性化基准(LaMP-2 分类和 LaMP-3 评级)上,每个基准都有超过 200 个保留用户,Muse 并没有显着改进其自身的未进化种子提示或对不匹配的用户支持对进行元训练的结构破坏控制,并且主要由评级任务上的简单的几次样本检索(Delta MAE +0.175,p < 0.001)。我们将这些结果归因于单一机制,即元目标崩溃:元验证目标在统计上对于用户支持对应关系是否真实而言是不变的(LaMP-2 上 p=0.555,LaMP-3 上 p=0.622),因此它不能优化为可转移的适应,而是奖励指令完善和验证过度拟合。种子提示、错误支持和不变性预言控制形成了一个可重用的协议,将习得的适应与这些混淆分开。