论文
自回归多特征论文评分的特征感知策略优化
Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
摘要
多特征论文评分旨在跨多个维度提供对写作质量的细粒度评估。然而,如何有效地对自回归评分模型进行后训练仍有待探索。在本文中,我们提出了特征感知策略优化(TAPO),这是一个专为自回归多特征评分量身定制的 后训练 框架。我们的方法沿着样本和特质维度分解奖励,结合全局评分一致性、特质水平准确性、格式有效性和特质间依赖性保留。此外,我们在整个训练过程中使用增强的提示,结合原始提示文本和特征描述,为特定特征的分数生成提供更丰富的语义信息。跨多个骨干模型的实验表明,我们的方法在监督 微调 和标量奖励优化基线上持续提高了多特征评分性能,证明了特征感知 后训练 对于论文评分的有效性和可转移性。