论文

心理上有效,计算上不可见:LLM 生成他们无法检测到的社交比较引出帖子

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

模型评测基准与评测资源

摘要

我们引入了小红书社交比较读者启发(XHS-SCoRE),这是一个基于读者的基准,用于从第一人称读者的角度检测纯文本小红书(RedNote)帖子是否引发向上、向下或中性/没有明确的社交比较。该任务的目标是具有社会意义的关系、行为真实的信号,不能简化为情绪。在提示 LLM 分类器和有监督的中文编码器中,我们发现了一致的生成检测不匹配:信号在域内是文本可学习的,但不能稳健地访问基于提示的分类。提示的 LLM 分类器显示出稳定的故障,特别是比较引出的帖子和模型特定的方向倾斜的中和。受控试验表明,即使基于即时的相同结构检测仍然脆弱,LLM 生成的小红书式帖子也可以改变感知的立场和比较相关的影响。 XHS-SCoRE 为基于读者的比较检测提供了基准,并为研究何时具有社会意义的关系线索对于基于提示的推理仅部分可见提供了一个诊断框架。