论文

驯服 CATS:通过带有控制词元的指令 微调 进行可控自动文本简化

Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens

模型训练监督微调与指令调优

摘要

可控自动文本简化(CATS)产生用户定制的输出,但可控性通常被视为解码问题,并使用不反映控制措施的指标进行评估。我们观察到 ATS 的可控性受到数据和评估的显着限制。为此,我们引入了一个基于具有离散控制词元的指令 微调 的与领域无关的 CATS 框架,引导开源模型达到目标可读性级别和压缩率。在具有不同模型大小(Llama、Mistral、Qwen;1-14B)和四个领域(医学、公共管理、新闻、百科文本)的三个模型系列中,我们发现较小的模型(1-3B)可能具有竞争力,但可靠的可控性在很大程度上取决于训练数据是否编码了目标属性的足够变化。可读性控制(FKGL、ARI、Dale-Chall)是一致学习的,而压缩控制由于现有语料库中的信号变异性有限而表现不佳。我们进一步表明,标准简化和相似性度量不足以衡量控制,从而激发了基于误差的目标输出调整措施。最后,我们的抽样和分层实验表明,朴素的分割可能会引入分布不匹配,从而破坏训练和评估。