论文

零样本作者归属中的LLM与风格嵌入比较

Author Representation Strategies for Zero-Shot Authorship Attribution: A Comparative Study of LLM-Based and Embedding-Based Approaches

模型评测模型能力评测

摘要

作者归属(AA)需要捕捉细粒度风格,零样本(ZS)且无任务监督时尤其困难。我们通过比较仅标签提示与三种作者表示,研究表示对零样本归属的影响:代表性写作样本、LLM生成描述,以及LISA风格嵌入。前三种通过LLM提示做归属,嵌入方法使用风格嵌入余弦相似度。我们研究提示设计的影响,并提出结合候选空间缩减与嵌入维度选择的两阶段嵌入归属框架。纯标签零样本方法无效,加入作者特定表示则持续改善。两阶段LISA整体表现最好,LLM风格描述以部分归属性能为代价,提供更紧凑作者表示。这说明作者表示对零样本归属至关重要,同时当前开源LLM若无更有效表示学习,仍不足以稳健归属。