论文

角色很重要:激活引导对简短答案生成和评分的影响

Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

模型评测模型行为与机制分析

摘要

基于激活的控制可以实现 大语言模型 的推理时间个性化,但其在教育应用中的影响尚不清楚。我们研究了基于激活的角色向量,代表简答生成和 ASAP-SAS 基准自动评分中的七个角色特征,涵盖跨越密集和专家混合架构的三种语言模型。角色引导会降低整体答案质量,对开放式英语语言艺术 (ELA) 提示的影响比对事实科学提示的影响大得多。解释性和论证性任务尤其敏感,表现出高达 11$\times$ 的退化。在评分方面,我们观察到可预测的价对齐校准变化:“邪恶”和“不礼貌”的评分者评分更严厉,而“好”和“乐观”的评分者评分更宽松。 ELA 任务比科学任务更容易受到评分者个性化的影响 2.5-3$\times$,并且专家混合模型显示比密集模型大大约 6$\times$ 的校准偏差。据我们所知,这是第一项系统地研究激活引导的角色特征在教育生成和评分中的影响的研究。我们的研究结果强调了在教育环境中部署个性化模型时需要进行任务和架构感知校准。