论文

后训练失去了什么:默认坍缩与上下文可控性

What Is Lost in Post-Training? Default Collapse and the Loss of In-Context Steerability Across Diverse Perspectives

模型训练监督微调与指令调优

摘要

服务异质人群的AI模型必须按适合每个用户与情境的原则行动。虽然后训练已知会收窄大语言模型表达的观点,但既往工作聚焦默认行为而非适配上下文信息的能力。我们证明后训练还会削弱模型在上下文中转向其未被训练偏好的立场的能力。在受控实验中,我们把模型向文化价值分歧的一方微调并评估整个训练过程的检查点:被训练一方在普通使用中日益占主导,而识别并忠实执行对立立场的能力下降。这些发现揭示了优先单一价值集与保留服务多元利益相关者所需技术能力之间的张力。最后我们提出并分析一个替代目标:在规定的表达立场分布约束下最大化奖励,并给出立场分布匹配作为可行实现。