论文
LLM 对汉语零代词了解多少?
How Much Do LLMs Know About Chinese Zero Pronouns?
摘要
零代词(ZP)是中文等支持放弃语言中普遍存在的语言现象,长期以来对自然语言处理系统提出了挑战。尽管 大语言模型 (LLM) 在许多中文任务上表现良好,但它们处理 ZP 的能力仍然知之甚少。我们通过一系列语言驱动的任务,包括识别、指称分类、指称类型分类、解析和翻译,对 LLM 对中文 ZP 的处理进行了系统的调查。在所有任务中评估一组不同的 LLM。我们的结果表明,中文 ZP 对于当前的 LLM 仍然具有很高的挑战性,特别是对于识别和参照分类等上游任务。下游任务(例如 ZP 翻译)的性能也一直很低:即使是最先进的面向推理的 LLM 也能正确地将不到一半的中文 ZP 翻译成英文。