论文

以AI应对AI:保护练习免受AI作弊的可行性

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

模型评测安全与风险评测

摘要

大规模生成式AI的广泛应用使学生能够将认知努力外包给越来越强大的助手,从而产生一种自满感,而这种自满感又削弱了教育旨在培养的独立推理能力。我们研究是否可以重新利用对抗性机器学习来保护教育练习不受这种腐蚀性依赖的影响。我们的方法使用多模态的选择题,其视觉组件可以使用微妙的视觉扰动来保护AI解题者,引导其错误答案。这些答案形成一个统计指纹:盲目的学生复制解题者的结果,比真正的学生更频繁地重复诱导的答案模式。我们使用三种最常用的最先进的多模态语言模型(Anthropic的Claude、Google的Gemini和OpenAI的ChatGPT)来研究这一范式的可行性,这些模型在黑盒助手假设下使用可访问的替代模型进行优化,以诱导一致的响应模式。这些模式使原理性的统计假设测试能够进行原则性的检测。这些发现既展示了对抗性机器学习保护教育练习的潜力,也揭示了机器本身的弱点。

以AI应对AI:保护练习免受AI作弊的可行性:论文配图
图1:使用一组代理模型优化细微的视觉扰动,使闭源 AI 助手倾向于给出指定错误答案。在一项作业的多个回答中,这些受控错误形成统计信号,用于区分真实作答与盲目复制 AI 的行为。