论文
当模型遇见用户:一般LLM和多模态LLM对拥抱脸部感知的实证研究
When Models Meet Users: An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face
摘要
大语言模型 (LLM) 已从通用系统迅速发展为能够处理文本、图像和音频的多模式模型。随着通用 LLM (GLLM) 和多模态 LLM (MLLM) 获得广泛采用,了解用户在现实环境中的感知变得越来越重要。然而,现有的研究往往依赖于调查或特定平台的数据(例如Reddit或GitHub问题),这些数据要么通过预定义的问题限制用户反馈,要么过分强调失败驱动、面向调试的讨论,从而无法在实践中捕捉多样化、体验驱动和跨模型的用户观点。为了解决这个问题,我们对 Hugging Face 上的用户讨论进行了实证研究,Hugging Face 是一个拥有多种模型和活跃社区的主要模型中心。我们从 38 个代表性模型(21 个 GLLM 和 17 个 MLLM)收集并手动注释了 662 个讨论线程,并开发了一个三级分类法来系统地表征用户关注的问题。我们的分析表明,LLM 访问障碍、生成质量以及部署和调用复杂性是最突出的问题,此外还有文档限制和资源限制等问题。基于这些发现,我们得出了改善 LLM 生态系统的可行建议。