论文

在线调查中智能体AI能力与数据质量控制的竞赛

The Race between Agentic AI Capabilities and Data Quality Control in Online Surveys

模型评测安全与风险评测

摘要

在线调查是各个领域的基本数据收集工具,注意力检查是响应质量的关键守护者。然而,代理人工智能(由大语言模型(LLM)大脑和/或具有工具增强功能的多模态处理单元驱动的目标导向系统)的快速出现对这些保障措施的稳健性提出了新的问题。我们研究代理人工智能架构如何完成基于网络的调查并通过标准注意力检查。我们评估了一种能够在受控调查沙箱上进行多模态输入处理和基于工具的网络交互的单代理架构。我们从两个角度来分析这个问题。从攻击的角度来看,我们演示了暴露的 DOM 元数据和可预测选项编码等结构漏洞如何允许代理仅通过结构化解析来解决注意力检查。从防御的角度来看,我们实施了 DOM 元数据混淆的缓解策略,以删除基于文本的问题中的语义线索。我们评估多种开源语言和多模态模型来研究能力和编排有效性。根据我们的评估,我们提供了关于如何同时满足经验主义者和代理人工智能研究人员的需求的观点。

在线调查中智能体AI能力与数据质量控制的竞赛:论文配图
图1 以大语言模型为媒介的调查参与方式。(Top) 人与人之间互动。被申请人询问一个大语言模型,接受模型生成的答案,并手工提交。虽然内容来源于该模型,但人的身份仍然是提交前的最后检查,并可能拒绝或修改错误的产出。完全自主的互动。大语言模型可以直接看到调查界面,在没有人力干预的情况下执行答复。辅助环境下存在的最终人员核查步骤不存在。