论文
CheeseBench:在啮齿类行为神经科学范式上评估大语言模型
CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms
摘要
我们提出CheeseBench,一个在九种经典行为神经科学范式(Morris水迷宫、Barnes迷宫、T迷宫、放射臂迷宫、星形迷宫、操作箱、穿梭箱、条件性位置偏爱和延迟非匹配样本)上评估大语言模型(LLM)的基准,覆盖六个认知维度。每个任务都以经同行评审的啮齿类实验方案为基础,并配有近似动物基线。智能体只收到不含任务特定指令的统一系统提示,必须完全从ASCII文本观察与奖励信号中发现目标,就像被放进陌生装置的啮齿动物一样。我们在基于文本的ASCII渲染上评估六个开放权重LLM(3B至72B参数),并与随机基线和基于图的强化学习智能体对比。我们最好的模型(Qwen2.5-VL-7B)在ASCII输入上平均成功率达52.6%,而随机智能体为32.1%,近似啮齿动物基线为78.9%。我们发现:(1) 规模超过7B后收益递减;(2) 更长的上下文历史会降低性能;(3) 思维链提示有害而非有帮助;(4) 视觉-语言架构在7B时带来优势,在32B时反而有害。由于同一模型的性能仅因接口参数不同就可在20%到57%之间变化,这些结果刻画的是「智能体+接口」这一系统,而非孤立的模型。在这一统一的零样本ASCII协议下,当前开放权重LLM智能体仍远低于近似啮齿动物参考值,尤其是在需要空间导航与试次内状态跟踪的任务上。
