论文

微调 万岁:特定任务 Transformer 在 Reddit 上的错误信息响应分类方面优于零样本 LLM

Long Live Fine-Tuning: Task-Specific Transformers Outperform Zero-Shot LLMs for Misinformation Response Classification on Reddit

模型评测模型能力评测

摘要

随着 大语言模型 (LLM) 成为在线信息验证的默认工具,一个隐含的假设随之而来:规模和一般能力足以对错误信息话语进行细致的分类。我们直接在 900 条 Reddit 评论上测试了这一假设,这些评论涉及三个经 PolitiFact 验证的错误信息主张(环境、健康、移民),标记为信念(传播主张)、事实核查(纠正主张)或其他。我们在通用和特定主题标签模式下比较了三种范式的九个模型——BART-MNLI、三种 Llama 变体、三种商业前沿 LLM(Claude Haiku 4.5、Gemini Flash Lite 2.5、Claude Sonnet 4.6)以及微调的 DistilBERT 和 RoBERTa。该假设不成立。经过微调的 RoBERTa 达到 0.62 宏-$F_1$,而最佳零样本结果为 0.50 (Claude Haiku 4.5),而每次查询成本只是一小部分;监督优势集中在信念类别,即每个零样本模型检测不足的隐式情感类别。缩放没有帮助:Llama-3-8B 与 Llama-3-70B 匹配,而 Claude Sonnet 4.6 在通用标签下的表现不如较小的俳句,将置信度检测压缩到 0.17,并彻底拒绝标记为敏感的评论子集。这是安全调整人工制品,而不是容量限制。标签模式和主题共同塑造零样本性能,同一模型在匹配标签下的主题之间变化超过 0.13 个宏 $F_1$。在验证环境中,缺失信念是代价更高的错误,尽管大型生成模型不断激增,但特定于任务的 微调 仍然是更可靠的选择。