论文

韩语27B语言模型响应风格对齐的非目标效应

Off-Target Effects of Response-Style Alignment in a Korean 27B Language Model

模型评测模型行为与机制分析

摘要

我们对 Qwen3.8-27B 进行后训练,针对韩国的反应风格(冗长、列表和降价的使用、话语结构和语域),并衡量目标从未针对的两种行为:对 KoBBQ 中模棱两可的社会问题的弃权,其中基准正确答案未知,以及证券指南中的无提示披露。两者都会移动,并且变化主要通过模型的排放策略来表达:它回答的频率和回答的数量。匹配的目标形式控制表明,答案倾向取决于训练目标,而不仅仅是提示集或配方。保持提示、配方、数据量和服务固定并仅更改目标文本,三种风格的种子给出积极的答案率点估计(平均+0.82 pp),三种中性种子给出消极的答案率点估计(平均-1.53 pp);观察到的种子范围不重叠,平均值相差 2.34 pp。它们之间有一个长度匹配的臂,而在保持对冲的同时保持较短的第四个臂在种子之间不稳定,因此该形式的哪个特征负责尚未解决。对于绝对刻板暴露,分解为答案倾向项和条件构成项是代数恒等式,而不是发现;它的经验内容就是运动的去向。在经过训练的检查点中,变化主要由答案倾向主导,而组合项保持较小,并且因为该项是在依赖于治疗的答案子集上评估的,所以我们不会将其视为有关潜在偏好的证据。以下是两个测量结果。当答案状态依赖于治疗时,条件刻板份额的臂间对比并不能识别条件内容偏好的变化。对于同一构造,两个规则检测器之间的一致性从 0.44 到 0.99 不等,具体取决于哪个检查点生成文本——无需任何参考标签即可观察到。