论文
大语言模型 中中文歧义理解的评估
Evaluating Chinese Ambiguity Understanding in Large Language Models
摘要
语言歧义对于 大语言模型 (LLM) 的鲁棒性至关重要,但现有研究主要集中在英语上,对中文的关注有限。现有的中文歧义数据集(例如 CHAmbi)可扩展性较差。在潜在歧义(PA)理论的指导下,我们设计了一个半自动管道来构建CHA-Gen。这是第一个基于 PA 理论的中文歧义数据集,包含 18 个潜在歧义结构的 5,712 个句子(2,414 个歧义句,3,298 个明确句)。通过直接查询和机器翻译评估LLM(例如Gemma 3、Qwen 2.5/3系列),我们发现LLM在歧义检测方面遇到困难(通过CoT提示改进)。对 Qwen3-32B 的 CoT 基本原理的分析揭示了三种常见的故障模式:模糊性盲目性、错误归因和过早解决。使用语义熵度量的不确定性量化显示歧义句子具有更高的不确定性。此外,指令调整会导致过度自信,而基础模型可以更好地捕捉语义多样性。我们进一步观察到模型表现出对主导解释的偏见。我们的工作为中文歧义语料库提供了一种可扩展的方法,并深入了解了 LLM 的歧义处理,为加强 LLM 中的中文歧义研究奠定了基础。