论文

通过基于 LLM 的语义原型优化进行零样本分类的迭代定义细化

Iterative Definition Refinement for Zero-Shot Classification via LLM-Based Semantic Prototype Optimization

上下文与知识上下文工程

摘要

Web 过滤系统依靠准确的 Web 内容分类来阻止网络威胁、防止数据泄露并确保合规性。然而,由于现代网络的动态和快速发展的性质,分类变得越来越困难。基于嵌入的零样本方法将内容和类别描述映射到共享语义空间,无需标记训练数据即可实现标签分配,但对定义质量保持高度敏感。不明确或模糊的定义会在嵌入空间中造成语义重叠,从而导致系统性错误分类。在本文中,我们提出了一种自适应迭代定义细化框架 无需训练,该框架通过逐步优化类别定义而不是更新模型参数来改进零样本 Web 内容分类。使用 LLM 作为反馈驱动的定义优化器,我们研究了三种细化策略,即示例引导、混淆感知和历史感知,每种策略都使用来自错误分类实例的结构化信号来细化类描述。此外,我们引入了 10 个 URL 类别的人工标记基准,每个类别有 1,000 个样本,并评估 13 个最先进的嵌入基础模型。结果表明,迭代定义细化持续提高了不同架构中的分类性能,将定义质量确立为基于嵌入的系统中一个关键且尚未充分探索的因素。该数据集可从 https://github.com/naeemrehmat/B2MWT-10C 获取。