论文

低成本开放智能体加剧问卷中的 LLM 数据污染

Cheap, open agents make LLM pollution harder to mitigate

模型评测安全与风险评测

摘要

当合成响应污染了旨在捕获人类行为的数据时,就会发生大型语言模型 (LLM) 污染。迄今为止,高昂的部署成本限制了自主调查代理带来的风险。然而,与开源 Agentic 框架相结合的开放权重模型可能已经消除了这一障碍。我们比较了九种代理配置的性能和可检测性,从完全开放的变体到封闭的商业变体。每个代理自主完成一项包含多种响应类型的调查,产生各种检测检查。完全开放的代理在本地运行,无需使用费,并且与商业替代品相比具有竞争力。开放和商业代理未能通过不同的检查集,并且没有任何一项检查能够可靠地检测到所有代理,但开放文本响应可以最好地区分代理和人类。这些发现将完全开放的代理确定为大语言模型污染的独特风险,并支持强调开放文本分析的多层检测策略。

不同调查智能体与人类回答分布的标准化欧氏距离;数值越大表示差异越大。
图1(图注摘要):不同调查智能体与人类回答分布的标准化欧氏距离;数值越大表示差异越大。