论文

GoCoMA:大语言模型 生成的代码归因的双曲多模态表示融合

GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution

摘要

经过海量代码语料库训练的 大语言模型 (LLM) 现在越来越能够生成难以与人类编写的代码区分开来的代码。这引起了实际问题,包括安全漏洞和许可模糊性,并且还引发了一个取证问题:“谁(或哪个 LLM)编写了这段代码?”我们提出了 GoCoMA,一个多模态框架,它对 (i) 代码风格测量之间的外部层次结构进行建模,捕获更高级别的结构和风格签名,以及 (ii) 二进制预可执行工件 (BPEA) 的图像表示,捕获由编译和工具链形成的较低级别、面向执行的字节语义。 GoCoMA 将模态嵌入投影到双曲庞加莱球中,通过基于测地线余弦相似性的跨模态注意 (GCSA) 融合机制将它们融合,并将融合表示反向投影到欧几里德空间以实现最终的 LLM 源归因。两个开源基准(CoDET-M4 和 LLMAuthorBench)上的实验表明,在相同的评估协议下,GoCoMA 始终优于单峰和欧几里得多峰基线。