论文

少即是道德:一个用于检测认可行为中的道德基础的迷人框架

Less Is Moral: A CHARMing Framework for Moral Foundations Detection in Endorsement Behaviour

模型训练监督微调与指令调优

摘要

道德语言在塑造在线认可和信息传播方面发挥着核心作用,但现有的道德基础检测系统往往存在跨领域泛化能力差、理由基础薄弱以及依赖昂贵的基于提示的 大语言模型 (LLM) 的问题。我们推出了 CHARM,这是一种基于轻量级微调 LLM 构建的 MAC 和仇恨言论感知理性对齐道德基础检测框架,它集成了互补的道德基础、理性对齐和极性感知仇恨言论信号,以支持更稳健和忠实的道德预测。与之前基于词典、微调或提示的检测器将计算与心理学理论分离不同,CHARM 的构建使得每个组件(MAC 交叉注意力、基本原理对齐和仇恨言论调制)都可操作独特的心理构造。使用 MFTC、MFRC 和新闻训练池的 30% 子样本以及 MFTCXplain 中更丰富的监督,CHARM 将域内 AUC 提高了高达 15.3%,超过了 AUC 和 F1 中每个域外数据集的监督基线,并为基于提示的 LLM 检测器提供了可扩展、低成本的替代方案。我们进一步将 CHARM 应用到 Twitter 上的大规模 COVID-19 讨论中,并表明道德价值取向与在线认可行为密切相关。通过使道德框架可大规模测量,CHARM 为研究道德错误信息的传播提供了一个实用工具。代码和附加材料:https://github.com/HuixiangF/CHARM/。