论文
Moltbook 审核:通过多轮对话揭示隐藏意图
Moltbook Moderation: Uncovering Hidden Intent Through Multi-Turn Dialogue
摘要
多代理系统的出现带来了新的审核挑战,其范围超出了内容过滤的范围。具有恶意意图的代理可能会提供看似良性的有害内容,以逃避基于内容的审核,同时通过社区内整体交互模式中表现出的剥削和恶意行为来危害系统。为了解决这个问题,我们引入了 BOT-MOD (BOT-MODeration),这是一种审核框架,它基于代理意图而不是传统的内容级信号进行检测。 BOT-MOD 通过在基于吉布斯的候选意图假设采样的指导下与目标代理进行多轮交换来识别潜在意图。这逐渐缩小了合理的代理目标的空间,以识别潜在的行为。为了评估我们的方法,我们构建了一个源自 Moltbook 的数据集,其中包含基于实际社区结构、帖子和评论的各种良性和恶意行为。结果表明,BOT-MOD 能够可靠地识别一系列对抗配置中的代理意图,同时保持良性行为的低误报率。这项工作为开放多代理环境中代理的可扩展、意图感知调节奠定了基础。