论文

从基线到偏好:LoRA/QLoRA 和心理健康文本分类偏好优化的比较研究

From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification

模型训练偏好优化

摘要

心理健康文本分类已迅速采用现代适应方法,但关于使用哪种优化策略、何时以及为何使用的实际指导仍然有限。本文对联合心理健康分类任务的优化途径进行了系统的比较研究,从强大的普通基线转向逐渐更专业的技术。我们首先建立经典和编码器参考,然后在多个目标和优化设置下使用 LoRA/QLoRA 检查参数高效的监督 微调,最后使用 DPO、ORPO 和 KTO 评估基于偏好的优化,包括类重新平衡训练。我们不强调单一的标题分数,而是关注方法论见解:性能如何随着目标制定、适配器选择、优化器行为、上下文窗口和类平衡干预而变化。结果表明,优化效果高度依赖于方法:一些方法提供稳定、可转移的增益,而另一些方法对配置和数据平衡敏感。特别是,偏好优化在不同目标之间表现出很大的差异,这表明方法选择比简单地添加偏好训练阶段更为重要。核心贡献是对心理健康 NLP 的清晰优化叙述:从透明的基线开始,应用受控调整,并在其收益可证明的情况下有选择地使用偏好优化。这提供了一个可重复且切实可行的框架,用于选择除架构选择之外的有效训练策略。