论文
LLM 用于普通话叙述文字记录的自动注释
LLMs for automatic annotation of Mandarin narrative transcripts
摘要
转录语音的语言注释对于语言习得、语言障碍和社会语言学的研究至关重要,但仍然是劳动密集型和耗时的。虽然 大语言模型 (LLM) 在自动化注释任务方面表现出了希望,但它们处理非英语语言中复杂的话语级注释的能力仍有待研究。本研究使用多语言叙事评估工具(MAIN)作为测试平台,评估 LLM 是否能够可靠地注释普通话口语中的叙事宏观结构(故事语法元素的层次结构)。我们将四个 LLM 与训练有素的人类注释者对儿童、年轻人和老年人制作的叙述进行了比较。性能最佳的模型与人类评分者达成一致 (k=.794),接近人类可靠性水平 (k=.872),同时将注释时间减少了 65%,而本地可部署的轻量级模型的性能要差得多。注释难度因宏观结构元素类型而系统地变化,需要微妙语义区分的类别构成了持续的挑战。此外,模型的可靠性在年轻人的叙述中下降,表现出更大的词汇变化、语义模糊性和单一话语中的多元素整合。这些发现表明,LLM 可以有效支持非英语口语语料库中的话语级注释,同时强调在语义复杂的任务中持续需要人工监督。我们的提示模板是开源的以供将来使用。