论文
ClinLens:迈向面向纵向多模态临床数据科学的长程LLM智能体
ClinLens: Towards Long-Horizon LLM Agents for Longitudinal Multimodal Clinical Data Science
摘要
自动化临床数据科学要求智能体将以患者为中心的目标转化为基于纵向多模态证据的可执行工作流。现有基准对两项关键能力的覆盖有限:将分析锚定到正确的患者病程,以及对多模态观测进行协调整合。我们提出ClinLens,一个以患者为中心的基准,用于评估大语言模型(LLM)智能体在长程临床数据科学工作流上的表现。ClinLens包含126个可执行任务,覆盖五种数据模态、四种分析范围与五项分析能力。这些任务评估智能体在证据锚定、多模态整合以及分析流水线生成与执行等相互依赖的阶段中,维持连贯的患者特定分析上下文的能力。我们评估了通用、编码与生物医学智能体,任务运行平均为36.93步、8.06分钟。被评估的最强智能体取得86.4%的执行成功率与54.0%的最终答案准确率,但严格通过率仅为29.4%。失败分析确定,在该评估流程下,患者病程锚定是被最频繁记录的失败类别。ClinLens通过联合评估分析结果与支撑性临床上下文的有效性,为推进面向纵向临床数据科学的可靠智能体提供了试验平台。