论文
推理还是记忆:LLM 能理解并生成中国歇后语谜语吗?
Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?
摘要
在本文中,我们通过在中文游戏“歇后语”中对其进行测试来突破 LLM 推理的界限,游戏中使用了由语言学家创造的以前不存在的小说“歇后语”,以避免数据污染。我们使用多项选择题(MCQ)、自由形式解释生成和新歇后语创建来评估LLM理解和创造歇后语的能力。在MCQ中,我们使用现有但低频的歇后语和新的歇后语之间的准确度增量($Δ_{acc}$)作为记忆指标。对于母语人士来说,$Δ_{acc}$ 非常低,表明类似的处理机制。然而,我们发现前沿中文模型的平均 $Δ_{acc}$ 为 23.6\%,而测试的以英语为中心的模型的平均 $Δ_{acc}$ 为 5.1\%,这表明前沿中文模型可能使用更大的中文数据进行训练,从而记住更多的低频歇后语。对于小说歇后语,Gemini 3.1 Pro 表现出了卓越的能力,acc 为 92.6,比人类准确率高 24%。在邪后语创作中,LLM创造的作品的评分比人类的要差得多。这些结果表明,考虑到数据污染问题,有关 LLM 推理能力的说法可能需要仔细重新审查,并且 LLM 在语言相关任务中的创造力可能仍然落后于人类专家,至少在中文歇后语中是这样。