论文
从任务成功到生产性成功:通过质量和成本评估人机协作
From Task Success to Productive Success: Evaluating Human-AI Collaboration by Quality and Cost
摘要
人工智能生产力通常通过任务完成时间、经济价值或结果质量的提高来衡量。然而,这些措施通常将协作视为一个黑匣子,它们捕获产生的输出,但不捕获产生输出所需的交互成本。受经济学文献的启发,我们引入了一种以生产力为导向的框架,用于评估人类与人工智能的协作,将其作为相对于交互成本的结果质量。在涵盖四个任务的两个数据集中,我们表明:(1) 具有相同质量评级的会话在交互成本方面可能相差高达 70 倍; (2) 质量-成本关系因任务而异,一些任务奖励扩展交互,而另一些任务则有利于快速收敛; (3) 主观的用户评分并不能可靠地替代生产力; (4) 富有成效的会话的特点是代理更早进行探测,而用户花费更少的精力来修复交互。通过区分生产性成功和代价高昂的成功,我们的框架使交互成本变得可见,并展示了对话分析如何为人工智能系统的评估和设计提供信息。