论文
ESL-Bench:面向健康智能体的事件驱动合成纵向基准
ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents
摘要
纵向健康智能体必须在融合连续设备数据流、稀疏临床检查与偶发生活事件的多源轨迹上进行推理——然而评估它们很困难:真实世界数据无法大规模发布,且基于时间的归因问题在缺乏结构化真值时很少有确定答案。我们提出ESL-Bench,一个事件驱动的合成框架与基准,提供100个合成用户,每个用户拥有1-5年的轨迹,包含健康档案、多阶段叙事计划、每日设备测量、周期性检查记录,以及带有明确单指标影响参数的事件日志。每个指标遵循一个基线随机过程,由带sigmoid起始、指数衰减核的离散事件驱动,并受饱和与投影约束;混合流水线将稀疏的语义产物交给基于LLM的规划,将稠密的指标动态交给带严格生理边界的算法仿真。每个用户配备100条覆盖查询(Lookup)、趋势(Trend)、对比(Comparison)、异常(Anomaly)、解释(Explanation)五个维度的评估问题,并分为易、中、难三档,所有真值答案均可从所记录的事件-指标关系通过程序计算得出。我们评估了涵盖带工具LLM、数据库原生智能体与记忆增强RAG的13种方法,发现数据库原生智能体(48-58%)大幅优于记忆RAG基线(30-38%),且差距集中在需要多跳推理与证据归因的对比与解释类问题上。
