多代理 LLM 可以识别其对等体吗?角色受限政治分析中的风格指纹识别
Can Multi-Agent LLMs Identify Their Peers? Stylometric Fingerprinting in Role-Constrained Political Analysis
摘要
用于政治声明分析的多智能体 大语言模型 (LLM) 管道容易受到同伴保护偏差的影响:模型倾向于保护同伴模型免于停用,并显示出与身份相关的评分扭曲。提出了提示级匿名化作为一种缓解措施,但之前的工作同时记录了风格指纹在角色受限的输出中可以幸免于匿名化 - 提出了这种缓解措施是否足够的问题。本文首次系统地研究了 LLM 是否能够在匿名条件下识别政治分析文本背后的模型家族。我们在涵盖四个商业 LLM 系列和一个开放世界“未知”类的五类归因任务上评估了三种分类器方法 - LLM 零样本和少样本(Claude Sonnet 4.6 和 Llama-3.3-70B)以及微调的 T5 基模型。我们引入了语句不相交交叉验证协议(SD-CV;在第 3.5 节中定义),该协议保证训练和验证数据之间没有内容重叠,并将其与运行不相交基线(RD-CV)进行对比。 T5 在 SD-CV 下实现了 Macro F1 = 0.991 (+-0.008),在 24 个完全保留的语句上实现了 F1 = 0.978 - 尽管训练测试内容距离与 RD-CV 相比增加了 2.1 倍(0.767 vs. 0.366,p<0.001),但仍然稳健,证明了真正的风格概括。分数 SD-CV 分析确定训练数据(约 440 个文本)的 40% 处存在性能拐点。我们的研究结果证实,仅即时级匿名化无法消除模型身份信号,这对欧盟人工智能法案合规性(第 13、14、26 条)以及质量关键型多代理部署中的计算机系统验证 (CSV) 具有直接影响。