论文
研究语言模型中句子理解策略的双任务范式
A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models
摘要
当语言模型(LM)的认知资源受到限制时,其行为更像人类,特别是在预测句子处理成本(例如阅读时间)方面。然而,目前尚不清楚这些限制是否同样影响句子理解策略。此外,现有方法并没有直接针对记忆存储和句子处理之间的平衡,而这是人类工作记忆的核心。为了解决这个问题,我们提出了一种双任务范式,将算术计算任务与句子理解任务相结合,例如“The 2cocktail + Blended 3 =...”我们的实验表明,在双任务条件下,GPT-4o、o3-mini 和 o4-mini 转向基于合理性的理解,反映了人类的理性推理。具体来说,这些模型显示,与单任务条件相比,双任务条件下合理的句子(例如,“鸡尾酒是由调酒师混合的”)和不合理的句子(例如,“调酒师是由鸡尾酒混合的”)之间的准确度差距更大。这些发现表明,对内存和处理资源之间平衡的限制促进了语言模型的理性推理。更广泛地说,他们支持这样的观点:类人的句子理解从根本上源于有限认知资源的分配。