论文
SocialPersona:通过多模式社交媒体环境对个性化分析和响应进行基准测试
SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context
摘要
个性化语言模型助手通常通过记忆透镜进行评估:模型能否回忆起用户在对话中明确表述的偏好?更全面的个性化需要更强大的能力——从用户自然留下的多模式痕迹中推断出用户关心的内容。我们引入了 SocialPersona,这是一个评估多模式 大语言模型 (MLLM) 是否可以从纵向社交媒体时间线中恢复显示的偏好并将其用于对话的基准。 SocialPersona 基于 171 个日常非促销性社交媒体用户的纵向时间线构建,包含文本、图像、时间戳和跨七个兴趣领域的 2,597 个经人工验证的偏好标签,将稳定兴趣与近期兴趣区分开来。它支持两项任务:从多模式上下文构建结构化的用户配置文件并生成与推断的配置文件一致的响应。专有和开放权重 MLLM 的实验表明,模型可以识别广泛的兴趣领域,但它们的性能在细粒度和近期兴趣上会下降,并且当必须使用推断的配置文件来个性化对话时,其性能会进一步下降。加上文本和图像提供互补偏好信号的证据,这些结果表明,强大的跨模式、长期用户建模仍然是一个关键挑战,而 SocialPersona 可以帮助衡量和推进助手推断并根据显示的偏好采取行动的进展。