论文
Ready2Blend:从自然语言指令到可组合对齐提示
Ready2Blend: From Natural-Language Instructions to Composable Alignment Prompts
摘要
持续的调整要求大语言模型适应新的要求,同时又不忘记以前获得的行为。自然语言指令灵活且可组合,但仅提供间接控制,而后训练以重复参数更新为代价提供更强的适应能力。我们引入了 Ready2Blend,它将自然语言的灵活性与学习对齐相结合。 AlignFormer 将每个要求映射到存储在模块化提示库中的固定长度对齐提示,而主干和先前的提示保持冻结。可组合性正则化将文本要求的语义几何转移到提示空间中,从而实现推理时间混合和重新加权。在两个实际的连续对齐设置中,Ready2Blend 是唯一与基于训练后的对齐方法相匹配的冻结主干方法,达到了具有竞争性保留的联合训练参考的 $93.1$-$98.5\%$,同时只需要几个提示词元,并减少高达 $4.3\times$ 的训练时间。其模块化设计进一步实现了加权个性化和无订单组合,无需重新训练。代码将在接受后发布。