论文

评估自主计算病理学的代理Harness系统

Evaluating Agentic Harness Systems for Autonomous Computational Pathology

智能体系统Agent任务评测

摘要

自主计算病理学 (ACP) 将高级病理分析目标转换为可执行、可追溯和临床界限的工作流程。实现这种能力需要使通用代理控制系统适应病理学特定的任务、工具、证据标准和临床索赔边界。我们贡献了 ACP-Bench,这是一个框架,可将现有的Harness系统从计算病理学支持调整为 ACP 工作流程功能。 ACP-Bench 评估 41 项病理工作流程任务,包括 24 项生物标志物、7 项形态学和 10 项预后任务,涵盖 6 个身体系统组和 9 个端点家族。该基准评估了 9 个模型和 3 个Harness组(Claude Code、Codex 和 Open Code),产生 369 个完整轨迹。 ACP-Bench 结合专家裁定的流程审核、诊断评估和病理学家验证的安全审查,评估工作流程执行、诊断性能和临床边界对齐的每个轨迹。在评估的系统中,工作流启动、任务解释和诊断报告比工具绑定执行、结果绑定和反思性工作流修订更加成熟,而正式的端到端完成仍然很少。 ACP-Bench 提供了一个可重复使用的标准,用于在声称可靠的临床自主权之前审核代理系统是否可以操作病理学工作流程。