论文
具体的任意差距:大语言模型中的亲属关系推理对陈述并非无动于衷
The Concrete-Arbitrary Gap: Kinship Reasoning in LLMs Is Not Indifferent to Presentation
摘要
我们测试当关系用熟悉的词汇或明确定义的随机数谓词表达时,大语言模型是否同样能很好地解决形式匹配的亲属关系问题。在 500 个配对图中,本地 Qwen3.8-27B 的具体准确度超出任意准确度 35.6 个百分点,Gemma 4 26B-A4B 超出 26.6 个百分点,Gemma 4 31B 超出 12.0 个百分点,Qwen3.8-Max 超出 5.4 个百分点。所有四个配对间隙均已在统计上得到解决。推理预算和及时语言干预可以大大减少这种差异,表明这种差异是可以改变的,而不是固定的无能力。最起码的结论是行为方面的:在这些任务中,模型所表现出的关系能力对于表现并不是无动于衷的。显式定义提供了形式关系,但并不使随机数谓词像嵌入所学语言关联中的熟悉词汇一样可用。