论文
一个模型不是一群人:多LLM和以方面为条件的多样化评论生成
One Model Is Not a Crowd: Multi-LLM and Aspect-Conditioned Diverse Comment Generation
摘要
互联网上的人类交流是由不同的观点塑造的,最明显地表达在在线评论空间中。随着基于大语言模型 (LLM) 的人工智能Agent开始占据这些空间,出现了一个关键问题:合成评论线程是否可以捕获人类话语固有的多样性。这种担忧变得越来越重要,因为随着时间的推移,人工智能生成的同质化内容的存在可能会减少多样性,从而可能导致模型崩溃并降低数字通信的丰富性。受人类群体的多元化和话语的方面驱动性质的启发,我们假设通过将多个LLM与方面条件生成相结合可以更好地近似评论多样性。我们使用来自不同提供商的模型来形式化和评估这种方法,并引入一个框架,该框架沿着三个轴:分散性、覆盖性和一致性来表征语义、语言和社会语用特征的多样性。使用这个框架,我们对跨多个领域的超过 200 万条 YouTube 评论进行了大规模研究。我们的结果表明,多LLM和方面条件生成更好地符合人类评论分布,并且此类数据在预训练风格管理下仍然可行,并且对下游任务有效。然而,人类的多样性仍然无与伦比。总的来说,我们的研究结果为在人工智能介导的环境中产生更加多样化和社会基础的话语提供了实践基础。