论文

超越表面表达:用编码机制分类识别LLM中的隐晦语言

Beyond Surface Forms: A Comprehensive, Mechanism-Oriented Taxonomy of Indirect Linguistic Encoding for LLM-Based Coded Language Detection

上下文与知识上下文工程

摘要

为了避免社交媒体上的审核和监视,一些用户经常发明间接语言表达(ILE)来隐藏敏感含义。这种伪装的表达方式表现为算法用语、委婉语和对抗性混淆,具体取决于意图和上下文,并且通常涉及重复出现的编码机制。我们提出了一种全面的、面向机制的 ILE 分类法,它从交际目标中抽象出来,而是对意义被编码和恢复的底层操作进行了分类。我们通过将分类法合并到 大语言模型 (LLM) 提示中来评估分类法,并使用 2,000 个手动注释的 TikTok 和 Bluesky 帖子,将其与四个现有分类法和无分类法基线进行比较。所提出的分类法在三个 LLM 中获得了最强的文档级和跨度级性能。与表现最佳的基准相比,GPT-5.4 的文档级准确度提升为 +3.8 个百分点/+4.3 个宏 F1 个百分点,Sonnet 4.6 的文档级提升为 +0.9/+1.3 个百分点,DeepSeek V4 的文档级提升为 +2.1/+2.2 个百分点。虽然改进的方向是一致的,但其幅度取决于模型。跨度级别的增益主要是由更高的召回率驱动的,有时是以牺牲精确度为代价的。在对 800 篇中文编码语言评论进行的额外跨语言评估中,未适应的分类法也在三个 LLM 中实现了最高的文档级和跨度级 F1。实证结果揭示了全面的、以机制为导向的分类法作为检测新兴编码语言的稳定支架和内容审核的有用输入的重要性。免责声明:本文包含可能亵渎、粗俗或冒犯性的内容。