论文
PERSA:用强化学习实现LLM的教授风格个性化反馈
PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
摘要
大语言模型(LLM)可以在教育场景中提供自动反馈,但要让LLM的风格与特定教师的语气对齐、同时保持诊断正确性,仍然具有挑战性。我们要探究的问题是:如何更新用于自动反馈生成的LLM,使其与目标教师的风格对齐而不牺牲核心知识?我们研究如何利用人类反馈强化学习(RLHF)使基于transformer的LLM适配生成符合教授评分口吻的编程反馈。我们提出PERSA,这是一个RLHF流水线,结合了对教授示范数据的监督微调、基于成对偏好的奖励建模以及近端策略优化(PPO),同时有意将学习约束在承载风格的组件上。受对transformer内部机制分析的启发,PERSA采用参数高效微调。它仅更新顶部的transformer块及其前馈投影,在提升风格可控性的同时将全局参数漂移降到最低。我们在三个代码反馈基准(APPS、PyFiXV和CodeReviewQA)上评估所提方法,使用风格对齐与忠实度的互补指标。在Llama-3和Gemma-2两种骨干上,PERSA在保持正确性的同时实现了最强的教授风格迁移,例如在APPS上,它将风格对齐分数(SAC)提升到96.2%(基线为34.8%),且在Llama-3和Gemma-2上的正确率(CA)高达100%。总体而言,PERSA通过对齐“说什么”(内容正确性)以及关键的“怎么说”(教师式的语气与结构),为个性化教育反馈提供了一条实用路径。
