论文
评估针对基于视觉语言模型的抄袭的对抗性防御中的语义到几何差距
Evaluating the Semantic-to-Geometric Gap in Adversarial Defenses Against Vision-Language Model-Based Plagiarism
摘要
视觉语言模型(VLM)快速发展的能力对学术诚信提出了系统性挑战。 VLM 现在允许学生通过捕获图形问题并将其作为单一图像提交来绕过有意义的参与,我们将这种做法定义为微不足道的抄袭。为了向教育工作者提供有关 VLM 局限性的可操作数据,我们研究了启发式对抗性图像转换的功效,该转换旨在降低模型性能,同时保持人类可解释性。通过介绍性评估的两阶段评估,我们手动评估电路图上的基线 VLM 性能,然后对拓扑结构(逻辑门)和坐标几何(卡诺图)进行自动大规模评估。我们发现,虽然功能强大的 VLM 可以表现出相当的鲁棒性,但所有模型都容易受到对抗性扰动的影响。我们的结论是,虽然视觉扰动是一种可行的短期权宜之计,但考虑到不断提高的 VLM 性能,长期评估安全性要求教育工作者重新考虑评估设计。