论文
MedicalHarness:医疗任务中 LLM 与智能体 Harness 的受控评估
MedicalHarness: A Controlled Evaluation of LLMs and Agent Harnesses on Medical Tasks
摘要
LLM 智能体越来越多地用于医疗工作,并以临床基准评分。然而,每个分数都来自在某个智能体 Harness 内运行的模型;Harness 控制模型与环境之间的循环。因此,智能体分数是模型与 Harness 配对的属性。医疗智能体的结果随 Harness 改变多少,目前很少被测量。测量并解释这种变化有两个挑战:第一,比较时只能改变 Harness,并在不同模型和任务类型上重复;第二,只比较完整 Harness,会把多个机制捆绑起来,无法判断单一机制何时有效。为此,我们提出 MedicalHarness,一项针对医疗任务中模型与 Harness 的受控研究。我们首先构建 MedicalHarnessBench,在四个领域的 $107$ 项任务上评价智能体,每个领域测试不同的 Harness 能力。然后用五个开放权重模型分别运行五种 Harness,每次比较仅改变 Harness,分析结果与执行轨迹。为研究单项机制,我们建立 MH-Lab,在共享执行循环中,依次关闭上下文管理、规划或工具暴露中的一项。结果显示,Harness 及其与模型的交互解释约四分之一的结果方差,而且没有任何一种 Harness 在所有模型与任务上都最佳。代码与数据位于 https://github.com/REAL-Lab-NU/MedicalHarness。
