论文
VARM-Bench:中文辱骂言论审核中可验证结构化推理基准
VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation
摘要
辱骂性网络内容的广泛传播增加了对中文社交媒体文本可靠审核的需求。现有中文基准支持标签分类、细粒度毒性归类与面向目标的抽取,但无法为确定性地验证审核决策所述依据提供统一表示。我们提出VARM-Bench,一个面向中文辱骂言论审核中字段锚定思维链理由的基准。每个实例包含一条简洁的自然语言理由,并为六项决策提供显式锚点:目标、目标类型、目标显隐性、作者立场、危害性标签与细粒度类别。我们的确定性协议在最终决策正确的前提下评估字段正确性、目标对齐、输出有效性、完整记录一致性与隐藏记录错误,而不依赖LLM裁判。在统一的结构化输出协议下,我们使用零样本提示、分类法引导与结构化CoT监督评估多个模型家族的语言模型,并分析词汇线索敏感性与字段级错误。结果表明,标签层面的强表现可能掩盖完整审核记录中的大量错误。VARM-Bench为评估中文辱骂言论审核中的可验证理由提供了一个可审计、可复现的基准。
