论文
专家知情技能提示和 微调 汉语隐喻识别的跨数据集稳定性
Cross-Dataset Stability of Expert-Informed Skill Prompting and Fine-Tuning for Chinese Metaphor Identification
摘要
在文本分布和注释策略不同的数据集中,隐喻识别性能可能会发生显着变化。我们检查固定的专家知情程序是否比特定于任务的参数适应产生更均匀的跨数据集配置文件。比较了中文句子级隐喻识别的四种预设条件:BERT 微调 (BERT-FT)、基于 QLoRA 的 大语言模型 微调 (LLM-FT)、直接零样本 LLM 提示 (LLM-ZS) 和冻结的零样本提示程序技能(技能-ZS)。该技能可操作涉及上下文含义、基本含义、对比和比较的既定标准。评估涵盖 CMRE 测试和两个外部数据集 CCIME 和 CMC。微调分数是三个种子的平均值,而每个零样本分数来自一个确定性配置。 微调 在本机测试集上仍然最强:BERT-FT 达到 91.76 Macro-F1。 LLM-FT 具有最高的外部平均值 (83.52),而 Skill-ZS 接近于 82.92,并且在所有三个数据集中具有最高的外部下限 (82.64) 和最小的观察范围 (4.08 点)。在匹配的零样本比较中,添加技能减少了对每个数据集的隐喻预测。这大大降低了 CCIME 的误报率,但增加了 CMRE Test 和 CMC 的误报率。结果将专家告知的技能提示定位为更均匀地观察到的跨数据集性能的补充途径,而 微调 保留了其在本机数据准确性方面的优势。据我们所知,这是第一项在汉语句子级隐喻识别的同一跨数据集评估中将专家知情的程序技能与特定任务 微调 进行比较的研究。