论文
CHI-Bench:人工智能代理能否自动化端到端、长期、政策丰富的医疗保健工作流程?
CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
摘要
现实医疗保健运营的端到端自动化强调了当前基准中未充分体现的三种能力:政策密度、决策必须以医疗、保险和运营规则的大型库为基础;多角色组合:单个任务需要Agent扮演多个角色并进行切换;和多边互动:中间工作流程步骤是多轮对话,例如同行评审和患者外展。我们推出 $χ$-Bench,这是跨三个领域的长期医疗保健工作流程的基准:提供商事先授权、付款人利用管理和护理管理。每项任务都会向代理提供一个高保真模拟器中的临床案例,该模拟器包含通过 87 个 MCP 工具公开的 20 个医疗保健应用程序,必须通过工具调用和编写角色工件将其驱动到终端状态,并以 1,290 多个文档管理护理操作手册技能为指导。在 30 个代理Harness/模型配置中,最好的代理仅解决 28.0% 的任务,没有代理在严格通过^3 上清除 20%,并且在单个会话中执行所有任务会使性能下降至 3.8%。这些结果提出了这样的假设:类似的差距很可能出现在其他政策密集、角色组成、不可逆转的企业领域中。