论文

EEGAgentBench:评测脑电分析Agent的长短时程工作流

EEGAgentBench: Benchmarking LLM Agents on Short- and Long-Horizon EEG Analysis

智能体系统Agent任务评测长程任务评测

摘要

脑电(EEG)分析正在从短片段分类转向长时程解读,要求迭代积累证据、多步推理和协调使用专用信号处理工具。虽然LLM近期显示出自主分析脑电的潜力,现有Agentic脑电评测仍碎片化,只覆盖狭窄时程中的有限任务,协议不一致,缺少对推理、工具使用和工作流构建能力的全面评估。我们提出EEGAgentBench,一个系统评估LLM Agent长短时程脑电分析的统一基准。它覆盖从知识问答到睡眠分期的六类代表性应用,信号时长从两秒至近23小时,预测目标包括类别标签、事件区间和逐时段序列。这一设计支持统一评估知识推理、短时程解读、长时程事件检测与序列理解。基准还提供十个确定性脑电分析工具,仅暴露与任务相关的测量,Agent因而必须自主选择工具、迭代积累证据并构建多步工作流。我们比较来自15个模型家族的29种前沿LLM。结果表明,该基准能区分超越模型规模和推理成本的Agent能力,并揭示当前LLM Agent在长时程脑电分析,尤其持续证据积累与多步推理上的明显局限。