论文
BrainBench:全面评估LLM脑电理解能力
BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding
摘要
脑电图(EEG)分析不仅限于对记录进行预定义标签的分配;它需要连接自然语言指令、信号处理、定量证据和科学解释的工作流。我们称这种能力为 \emph{全面的EEG理解}。然而,现有的评估主要针对孤立的解码任务或特定系统的表现,未能充分量化大语言模型(LLMs)的能力。我们引入 \benchmarkname{},这是一个统一的基准,用于全面、指令条件下的EEG理解。它包括四个子集——基础分析、睡眠评估、神经认知评估和生理集成——覆盖17个数据集,\numcases{}任务和超过 \numinstances{} 实际数据实例。给定一个指令和带有可选生理信号的EEG记录,系统必须执行分析并生成科学依据的报告,当需要时,还应生成艺术作品。输出通过数值、类别、集合、序列、语义和艺术品验证。我们评估了超过100,000次代表性的LLMs,跨两种范式进行:自主代码执行(CodeAct)和结构化代理分析(BrainAgent)。结果在模型、子集、难度级别和执行范式之间显著变化,表明EEG能力取决于模型及其操作化。\benchmarkname{}为基于LLM的EEG理解提供了一个可重现的测试床。代码和基准将在不久后发布,评估结果将不断更新。
