论文

以休闲为锚:解决形式转移数据集中的监管错位

Casual as an Anchor: Resolving Supervision Misalignment in Formality Transfer Dataset

模型评测基准与评测资源

摘要

形式转移通常被视为非正式和正式寄存器之间的对称双向任务。我们认为,这种框架掩盖了 GYAFC 等现有基准中的监督设计缺陷:二进制人类重写编码了相对的风格转变,而不是绝对的人类形式概念。因此,模型学习生成满足基准标签的伪形式输出,但无法产生真正的形式语言。我们通过在符合人类的正式定义下重新评估基准正式标签来量化这种不一致,揭示了在模型系列中传播到一致的非正式到正式失败的实质性差异。为了解决这个问题,我们将形式转移重新概念化为分级维度而不是二元属性。我们引入了一个三级谱:非正式、休闲和正式,其中休闲作为明确监督信号的明确中间状态。基于这个框架,我们引入了 3LF,一个跨所有三个级别提供并行监督的数据集。 3LF 训练大大减少了非正式到正式的失败,并提高了与人类感知的一致性。例如,GPT-4.1-nano 在非正式到正式的方向上 F1 从 0.06 提高到 0.88,尽管 3LF 明显小于 GYAFC。我们进一步证明,这些成果不能仅通过上下文学习来重现,并提供对模糊性驱动的错误和意义扭曲的定性分析。总的来说,我们的研究结果证明了监督设计如何塑造风格对齐,并强调了对齐感知基准构建在可控文本生成中的重要性。