论文
对话中个人事实的标注方案和分类器
An Annotation Scheme and Classifier for Personal Facts in Dialogue
摘要
大语言模型(LLM)的进步使其能够在个性化对话系统中得到应用。我们提出了一种用于个人事实分类的扩展注释方案,解决了现有方法(特别是 PeaCoK)的局限性。我们的方案引入了新的类别(人口统计、财产)和属性(持续时间、有效性、后续),可以实现结构化存储、质量过滤和适合对话继续的事实识别。我们手动注释了多会话聊天中的 2,779 个事实,并训练了基于 Transformer 编码器的多头分类器。与 Gemma-300M 编码器相结合,分类器实现了 $81.6 \pm 2.6$\% 宏 F1,比所有小样本 LLM 基线(最佳:GPT-5.4-mini,72.92\%)高出近 9 个百分点,同时需要的计算资源大大减少。错误分析揭示了语义边界消歧、时间方面解释和后续评估的实用推理方面持续存在的挑战。数据集\footnotemark[1] 和分类器\footnotemark[2] 是公开可用的。