论文
检测在线调查中人工智能辅助的回答
Towards Detecting AI-Assisted Responses in Online Surveys
摘要
使用大语言模型来完成在线调查会影响基于调查的研究的有效性,但检测这种使用情况仍有待探索。我们引入了一个初始基准数据集,即 ASURRE,用于人工智能辅助调查参与,以捕获从完整生成和修订到基于角色的代理完成的使用策略。在这些策略的控制下,大语言模型协助的调查回复是使用多个大语言模型对不同学科的三项真实世界调查生成的,并与真实的人类回复配对。我们对现有机器生成文本(MGT)检测器的评估表明,简单的人工智能使用很容易被检测到,而模仿整个受访者的基于角色的代理将检测器的性能推向机会。我们进一步表明,代理完成不能完全复制受访者级别的行为并留下独特的行为痕迹。虽然可以通过有针对性的提示来规避个别线索,但对这些线索进行简单的几次射击、免训练聚合器可以将平均 AUROC 比跨代理设置的最佳现有检测器提高 +0.14。我们的项目位于 https://github.com/mike-qz-wang/ASURRE。