论文

LOCUS:用于词元高效语言生成的任务感知低秩 后训练

LOCUS: Task-Aware Low-Rank Post-Training for Token-Efficient Language Generation

模型训练参数高效训练

摘要

大语言模型 服务成本直接与输出序列长度成比例,但标准偏好对齐通常会增加响应的冗长性,而不会提高实用性。我们研究 后训练 更新的参数化是否影响生成长度:低秩子空间改变序列长度而不修改比对损失。我们提出了 LOCUS,一种选择任务感知的低秩适应子空间的方法,以在效用约束下最小化输出词元成本。在这个子空间内,后训练 保留了具有冻结主干的原生偏好目标。在 Anthropic HH-RLHF 对话偏好中,我们针对协议匹配的全参数 DPO 和 DrDPO 分支以及已发布的 SamPO 检查点评估了两个 $\sim$3B 解码器主干,Pythia-2.8B 和 Qwen2.5-3B。 LOCUS 在 Pythia-2.8B 上将连续长度减少了 39.84\%,在 Qwen2.5-3B 上减少了 14.87--17.58\%,同时仅更新了 0.24--0.28\% 的模型参数,内部偏好诊断没有发生重大变化。