论文
行为操控条件下用击键检测 LLM 辅助越南语写作
Detecting LLM-Assisted Vietnamese Writing via Keystrokes under Behavioral Manipulation
摘要
我们研究了用于检测大语言模型 (LLM) 辅助书写的击键动力学的鲁棒性。我们引入了越南语击键数据集,捕捉真实的写作模式,包括真实的写作、转录和释义。我们还定义了一个基于行为的威胁模型,其中用户故意改变打字模式。为了实现威胁模型,我们创建了数据的行为操纵变体,旨在逃避基于击键的检测。我们评估了四种击键建模方法:时间和节奏表示,以及在用户无关和上下文无关设置下使用一维卷积神经网络 (1D-CNN) 和 TypeNet 建模的顺序表示。结果表明,在大多数情况下,顺序模型优于基于特征的方法,并且击键信号编码有关书写过程的判别信息。然而,检测并不是一律稳健:转录被可靠地识别,而释义和对抗性操纵的样本在没有明确建模时经常被错误地分类为真实样本。为了解决这个问题,我们使用行为操纵数据合并对抗性训练,这大大提高了可分离性和鲁棒性。这些结果表明,基于击键的检测关键取决于接触不同的书写行为,并且在没有目标建模的情况下,有限条件下的强大性能不能推广到现实或对抗性环境。