论文
LLM 注释的细化和重用注释指南
Refining and Reusing Annotation Guidelines for LLM Annotation
摘要
虽然 大语言模型 (LLM) 在零样本注释任务中表现出卓越的性能,但它们经常难以应对黄金标准基准的专门约定。我们提出注释指南的系统重用和细化作为对齐机制,引入模拟注释项目早期阶段的迭代调节框架。我们评估三个假设:(1)指南整合的有效性,(2)推理优化模型的优势,以及(3)最小监督下适度的可行性。使用三个 LLM 系列(GPT、Gemini、DeepSeek)进行生物医学 NER 任务(NCBI 疾病、BC5CDR、BioRED)测试,我们的结果从经验上证实了所有三个假设。虽然迭代调节框架在有效完善指南方面显示出良好的潜力,但我们的分析也揭示了巨大的改进空间。