论文

评估 大语言模型 在社交媒体分析中的能力:多任务探索

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

模型评测模型能力评测

摘要

在本研究中,我们首次对现代 LLM(包括 GPT-4、GPT-4o、GPT-3.5-Turbo、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2 和 BERT)在 Twitter (X) 数据集上的三个核心社交媒体分析任务进行全面评估:(I) 社交媒体作者验证、(II) 社交媒体帖子生成和 (III) 用户属性推断。对于作者身份验证,我们引入了针对不同用户和帖子选择策略的系统抽样框架,并评估 2024 年 1 月以来新收集的推文的泛化情况,以减轻“已见数据”偏差。对于后期生成,我们使用综合评估指标来评估 LLM 生成真实的、用户喜欢的内容的能力。衔接任务 I 和 II,我们进行了一项用户研究,以衡量真实用户对 LLM 生成的帖子的看法(以他们自己的写作为条件)。对于属性推断,我们使用两种标准化分类法(IAB Tech Lab 2023 和 2018 U.S. SOC)来注释职业和兴趣,并根据现有基线对 LLM 进行基准测试。总体而言,我们的统一评估为 LLM 驱动的社交媒体分析提供了新的见解并建立了可重复的基准。代码和数据在补充材料中提供,也将在发布后公开。