HIRA:面向受监管行业文档分类的人在回路检索增强级联
HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries
摘要
受监管行业的文档分类受到数据驻留、冷启动标签有限、评审人力稀缺和高昂模型治理流程的制约。我们提出 HIRA,一个免训练、本地部署的检索增强级联,用于受监管部署中的文档分类:它通过验证校准的加权倒数排名融合,组合 OCR 文本上的 BM25、稠密文本嵌入和图像级表示。置信度高的文档直接由检索分类;不确定或视觉上易混淆的文档交给本地托管的 LLM 验证器,后者接收 OCR 文本、检索到的示例、标签描述和混淆特定术语。当验证器仍不确定时,文档送人工评审。每次修正都作为边际加权的检索示例存储,并更新一个狄利克雷平滑的混淆图,使系统无需更新模型权重即可改进。在一个 80 类的私有贸易金融语料上,HIRA 处理了全部 30,233 篇文档的生产流,仅对 1,945 篇(6.4%)请求人工修正,把 Macro-F1 从 0.6218 提升到 0.8548。在修正后的 Tobacco-3482 基准上,HIRA 以本地托管的 DeepSeek-R1-Distill-Qwen-32B 验证器达到 0.9423 Macro-F1,比零样本 LLM 基线高 17.4 个百分点,同时只对约 40% 的文档调用验证器,LLM 调用减少约 60%。凭借 518 次人工修正(占池的 24.8%),HIRA 达到全标注池 oracle 的水平,即池中全部 2,086 篇文档都以真值标签建立索引。这些结果表明,对受监管部署中的长尾文档分类而言,选择性人类反馈加检索记忆适配可以成为反复模型重训的实用替代。