论文
告诉我你如何推理,我会告诉你你是谁:强大的 LLM 作者归属的推理图
Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution
摘要
鉴于当前在几乎任何可以想象的环境中使用 大语言模型 (LLM) 的趋势,LLM 生成的文本检测和作者归属已成为一个紧迫的问题。之前的工作主要集中在表面语言特征上,这种方法很容易受到释义和其他混淆技术的影响。在本文中,我们超越了语言表面,提取并分析了 LLM 生成的文本中的推理结构,目的是捕获 LLM 作者身份的更复杂信号。我们提出了一种图神经网络方法,该方法利用参数挖掘管道提取的推理图,证明了比传统 Longformer 基线更高的鲁棒性和泛化性。在释义和回译等混淆攻击下,我们的方法比基线高出高达 27 个百分点;在对未见过的模型版本生成的文本进行评估时,比基线高出 19 个百分点,模拟新的 LLM 版本不断发布的现实条件。