论文
InterviewPlayground:评估人工智能面试官的模拟环境
InterviewPlayground: A Simulation Environment for Evaluating AI Interviewers
摘要
越来越多的人工智能采访者被开发出来,以在市场研究、公众投票、偏好诱导和社会科学研究等应用中引发开放式反应。然而,评估人工智能面试官具有挑战性,因为他们在扩展的多轮交互中发挥作用,必须适应参与者的行为。为了满足这一需求,我们开发了 InterviewPlayground,这是一个模拟环境,用于使用行为基于社会理论的模拟研究参与者来评估 AI 面试官。 InterviewPlayground 中的模拟研究生成 InterviewReportCard,它使用一套经过验证的措施来评估 AI 面试官的表现。为了测试我们基于模拟的评估是否可以预测人类参与者的表现,我们对 5 名 AI 面试官、3 个访谈主题和 450 名人类参与者进行了 15 项真实的定性研究,并将它们与 InterviewPlayground 中的模拟研究进行了比较。我们发现 AI 面试官在 InterviewPlayground 中的表现可以预测人类研究中的平均皮尔逊表现 12 项指标的相关性为 0.86,InterviewPlayground 的模拟交互再现了人类研究中人工智能面试官行为分析的关键发现。总之,这些发现支持 InterviewPlayground 在评估 AI 面试官表现和检查潜在失败模式方面的有效性。我们的工作为人工智能面试官提供了一个由经验验证支持的模拟环境,更广泛地说,为未来开发经过验证的、基于模拟的对话式人工智能系统评估工作提供了路线图。