论文

RiskChainBench:混淆平台消息恢复和循证网络调查的基准

RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation

智能体系统Agent任务评测

摘要

平台滥用活动利用表情符号、同音字、字符分解和冗余符号隐藏重定向指令,然后通过伪装的链接将用户引导至与色情、欺诈、赌博或非法交易相关的服务。现有的基准分别评估模糊文本和有风险的网页,模糊了目标恢复如何影响下游证据获取。我们引入了 RiskChainBench,将来自 600 个源会话的 3,600 个合成词元文本恢复输入与 600 个相应的人工标记本地 Web 环境配对。模型首先恢复消息、操作意图和目的地;然后,相同的底层模型充当 VLM 驱动的网络代理,调查正确关联的网站并生成冻结的、引用证据的风险报告,而无需消息端语义或域声誉线索。我们分别对恢复和正确路由网络调查进行评分,并通过应用冻结的主要条目预测作为相同任务 2 结果的门来离线组合它们。人类标签决定任务的正确性,而固定的多模式证据法官则评估忠实性、充分性、完整性和一致性。在 10 个模型中,Entry Top-1 的范围为 35.2% 至 95.2%,网络决策准确度为 26.3% 至 62.8%;领先的系统在条目恢复、完全重建、网站决策和细粒度打字方面有所不同。执行失败占网络运行的 31.9%,而决策后类型错误仅占 0.9%,这表明稳定探索和风险判断是主要瓶颈。我们发布了基准测试、协议和可重置的本地沙箱。