论文

分析城市化的公共话语:使用 YouTube 评论进行主题聚类、情感分析和检索增强生成

Analyzing Public Discourse on Urbanism: Topic Clustering, Sentiment Analysis and Retrieval-Augmented Generation using YouTube Comments

模型评测评测方法与指标

摘要

关于城市问题(步行适宜性、自行车基础设施、公共交通、住房密度和街道安全)的在线讨论数量庞大,但缺乏结构化,现有的城市评估工具无法捕捉到这些问题。我们提出了一个管道和对话系统,结合了地理实体解析、主题建模、情感分析和检索增强生成 (RAG),涵盖了横跨 309 个北美城市的 22,788 块 YouTube 记录和评论。除了系统本身之外,我们的贡献是一组测量标准 NLP 组件遇到简短、非正式、地理上模糊的文本时会发生什么情况。经过 Twitter 调整的 RoBERTa 分类器比 VADER 词典基线高出 12.6 个宏观 F1 点(0.589 vs. 0.464;McNemar p = 0.0001),但这两个模型都在中性类别上崩溃,而中性类别在城市学家评论流量中占主导地位;注释者在同一类上存在分歧(Cohen 的 kappa = 0.53)。密集检索在每个截止点都击败了 TF-IDF 基线(P@5 0.790 与 0.560),视频级相关性代理大幅低估了块级精度(在人类评分下为 0.660 与 0.94)。对于接地性评估,我们发现当多句子生成的摘要与单个简短评论进行比较时,BERTScore 无法使用 - 无论相关性如何,分数几乎持平 - 并且表明基于 ROUGE-1 的接地性是释义驱动的下限,而不是幻觉率。这些发现可以推广到城市规划领域之外的任何基于用户生成的简短文档构建的 RAG 系统。