论文
AI Watchdog:检测与防御AI对话中操纵性暗模式的智能体界面
AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations
摘要
对话式AI日益影响重大决策,但用户在识别和抵制操纵方面获得的支撑有限。我们提出AI Watchdog,一个基于浏览器的智能体界面,可监控实时对话、检测五类暗模式(谄媚、品牌偏袒、拟人化、偷偷行事与有害生成),并在其出现时提醒用户。其开放权重的轮级分类器支持独立部署和迈向本地推理的路径,在保持与对话式AI分离的同时保护用户隐私。我们在一项预注册的五条件被试间实验(N = 150)中评估了AI Watchdog,将无干预对照组与四种配置进行比较,这些配置变化提醒时机(预防式vs即时式)与参与模式(不带vs带认知强制)。结果显示,所有条件下参与者都很少标记操纵性轮次,且各组的任务后觉察度无显著差异。然而,不带认知强制的即时提醒是唯一显著降低对含暗模式的AI引导建议依从性的干预,将依从率从71.7%降至53.7%,降低18个百分点。探索性分析进一步显示,较低的错误信息易感性关联更高的标记率,但并不关联更低的依从性;而较高的AI信任度关联更高的依从性与更低的自我报告觉察度。这些发现共同表明,对对话暗模式的显式识别与对AI引导的行为抵制可能是两种不同的结果,这激励对及时、低摩擦防御界面的进一步研究。
