论文

DocHRL:面向成本优化的文档分类分层强化学习框架

DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification

AI 基础设施模型网关

摘要

现实中的文档分类流水线通常对每份来件应用相同的模型序列,而不考虑其复杂度或类型。这导致计算与人力资源的低效使用:简单文档被过度处理,而困难文档可能得不到足够的审查。我们提出DocHRL,一个分层强化学习框架,学习按文档自适应、动态地选择最具成本效益的分类策略。DocHRL将文档分类形式化为具有两级策略层次的序贯决策问题:顶层策略在若干大类选项(视觉分类器、LLM、OCR与人在环审核)中选择,而各选项特定的子策略选择要调用的具体模型或工具。奖励信号为负的总期望成本,涵盖推理成本、误分类成本与人工标注成本。使用近端策略优化(PPO)在RVL-CDIP基准上训练后,DocHRL在16个文档类别上取得0.973的宏F1,同时将单文档平均成本降至2.74个归一化单位,远低于固定独立分类器所产生的高得多的成本。我们的结果表明,成本感知的强化学习能够在文档理解系统中同时提升分类性能与运营效率。

DocHRL:面向成本优化的文档分类分层强化学习框架:论文配图
图 1:具有基于熵的升级的人机交互管道。分类器处理输入;如果归一化香农熵 ℋ\mathcal{H} 超过阈值 ThT_{h},则样本将升级为人类操作员。否则,分类器做出最终决定。