论文
顺序很重要:LLaMA 的连续 微调 用于连贯的自动论文评分
The Order Matters: Sequential Fine-Tuning of LLaMA for Coherent Automated Essay Scoring
摘要
自动作文评分(AES)系统必须判断相互依赖的话语元素(例如,引导、主张、证据、结论),但大多数方法孤立地对待这些元素,损害了连贯性和概括性。我们使用具有 4 位量化的参数高效 LoRA 研究 AES 的任务感知 微调 的 LLaMA-3.1-8B,并比较三种训练课程:(i)顺序(逐步 微调 引导,然后定位,然后声明,然后证据,然后结论),(ii)独立(特定于任务的模型),以及(iii)随机(洗牌的多任务)。 PERSUADE~2.0 语料库上的实验表明,建模任务依赖性很重要:顺序 微调 产生了最强的总体结果,包括 65%(证据)和 87%(结论)的 F1 分数以及 63% 和 85% 的相应准确度,超越了独立训练,并且在结论上优于通用 LLaMA-70B 基线,尽管其容量更大。随机训练提高了位置得分(57% F1),但在其他地方不太一致。这些发现表明,(1) 与话语结构相一致的课程设计可以显着改善 AES,(2) 小型任务优化模型可以与更大的 大语言模型 (LLM) 竞争,为可扩展、经济高效的评估提供了一条实用途径。我们发布模板和实施细节,以方便教育 NLP 课程设计的复制和未来工作。