论文

领域转移下的可靠金融命名实体识别:置信度估计和选择性预测

Reliable Financial Named Entity Recognition Under Domain Shift: Confidence Estimation and Selective Prediction

模型评测鲁棒性、公平性与可信度评测

摘要

金融人工智能系统通常在一个文本寄存器上训练信息提取器,并将其部署到文件、新闻和用户生成的内容中,而标准 F1 分数并不表明当输入分布发生变化时,哪些预测仍然可以安全地自动化。我们研究了金融命名实体识别 (NER) 的置信度估计和选择性预测,在涵盖 SEC 文件、金融新闻和一般主题社交媒体的三层压力测试中作为极端的域外条件,评估了 BERT 标记器和 LoRA 调整的 Qwen2.5-0.5B/1.5B 模型,具有五个推理时间置信信号、三个训练种子和引导间隔。置信度排名本身会随着转变而变化:整体输出概率是域内错误检测器中最强的,但在域外会恶化,而实体跨度概率和自一致性则更稳健;自我一致性也得到了更好的校准,无需事后拟合。弃权将最高置信度 40% 的域内输入的句子错误从 34.3% 减少到 2% 以下,并且对于财经新闻仍然有用,但在极端的社交媒体转变下没有恢复出有用的大的干净子集。这些结果激发了分阶段部署策略,该策略在应用预测级置信门控之前检测上游的严重分布变化。