论文
超越“AI帮助人类”:面向部署决策的人机团队评测设计
Beyond "AI Helps Humans": Decision-Targeted Evaluation Design for Human-Agent Teams in the Agentic Era
摘要
无论编码智能体在工程师的监督下工作,还是临床模型协助放射科医生,部署问题都是保留人类人工智能工作流程,还是仅用人类或单独的智能体取代它。只有击败这两种替代方案,人类-人工智能工作流程才值得保留。然而,一旦部署,就不会观察到任何替代结果:恢复一个结果意味着在该替代方案下重播任务,而每次重播都会花费专家时间或计算。因此,在固定的重播预算下,设计问题是哪些任务更有可能接收仅限人类的重播,哪些任务更有可能接收仅限智能体的重播。现有方法并不直接针对这一决定。智能体基准不会选择要测量哪个缺失的基线,基于方差的采样会忽略两个比较中哪一个更接近失败,贝叶斯信息方法侧重于学习模型参数而不是做出部署决策。我们提出了 TEAM-Design,这一规则为每个任务提供了两个重播概率,每个基线一个。当很难从已知的任务信息中预测缺失的基线结果以及更难建立比较时,它会提高概率;而在重播成本高昂的情况下,它会降低该概率。我们证明该规则解决了这个预算设计问题,并且从记录的概率中随机绘制重播仍然控制了错误地声明工作流程击败两者的机会。我们重新分析了 6 种临床环境(其中没有任何人类 AI 工作流程能够胜过这两种替代方案)和编码基准(其中有一种方案可以胜任),然后在合成设计和根据真实胸部 X 射线读取器研究构建的半合成设计上评估 TEAM-Design。当两种比较中的一种明显比另一种更难解决时,TEAM-Design 效果最佳,而当两者同样困难时,TEAM-Design 的效果可能比基于方差的分配更差。