论文

个体立场预测中,增加推理与训练为何未必有效

Where Do Test-Time Scaling and Training Fall Short in Individual Stance Prediction?

模型评测模型能力评测

摘要

测试时计算扩展和后训练提高了LLM在编码和数学推理方面的表现,但它们对个人立场预测的有效性仍不清楚。我们通过预测一个人在新的讨论中的立场来研究这个问题。我们评估了广泛使用的测试时计算扩展策略和后训练方法,例如监督微调和强化学习,并识别了生成、选择和学习的四种失败模式:(1)不正确的共识,其中重复的样本同意错误的立场; (2) 选择失败,即生成覆盖了观察到的立场,但选择却错过了; (3) 响应过度拟合,监督微调改善了模仿,但损害了预测; (4) 早期稳定期,强化学习显示出适度的初始收益,随后的进一步改进有限。我们使用 STANCE-BENCH 揭露这些失败,其中包含来自 500 名 Hacker News 用户的 2499 个预测任务。在此分析的指导下,我们探索了一种简单的方法,将所有候选立场的直接得分与个人历史支持的明确评估结合起来。在 781 任务测试集上,该方法使用 Qwen3-8B 获得了 21.83 讨论特定宏 F1,而直接评分为 19.27。我们的结果促使我们分别评估候选者的生成、最终选择和特定于个人的证据使用。