论文

WhoSaidIt:基于文本的多语言说话人属性分类的 Human-LLM 协作注释

WhoSaidIt: Human-LLM Collaborative Annotation for Text-Based Multilingual Speaker-Attribute Classification

模型训练合成数据

摘要

从文本中注释说话者属性本质上是不明确的,特别是在人口和社会线索隐含且文化可变的多语言环境中。我们提出了一种人类 大语言模型 (LLM) 协作重新注释框架,用于在实际资源限制下稳定多语言说话人属性标签。从嘈杂的语料库开始,我们使用 LLM 通过与专家的迭代交互来呈现重复出现的注释原理,并应用以分歧为中心的采样来进行有针对性的重新注释。使用这个框架,我们构建了 WhoSaidIt,一个涵盖九个说话者属性标签的多语言数据集。我们量化原始注释和修订注释之间的差异,对最近的 LLM 进行基准测试,并分析显式原理对模型行为的影响。我们的结果揭示了注释决策中的显着跨语言差异,并证明了 LLM 在说话人属性分类中的优点和局限性。