NeFut Logo NeFut
EN 管理员登录

[AI学术] DocHRL:一套层次化强化学习框架,实现文档分类的成本优化

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

现实世界的文档分类流程通常对每一个输入文档应用相同的模型序列,无论其复杂性或类型如何。这导致计算和人力资源的低效使用:简单文档被过度处理,而复杂文档可能未得到足够的审查。

我们提出了 DocHRL,一个层次化强化学习框架,能够自适应和动态选择每个文档的最具成本效益的分类策略。DocHRL 将文档分类问题表述为一个序列决策问题,采用了两级策略层次结构:顶层策略在广泛选项(视觉分类器、LLMs、OCR 和人工审核)中进行选择,而选项特定的子策略则选择具体的模型或工具进行调用。

奖励信号为负的总预期成本,它考虑了推理成本、误分类成本以及人工标注成本。通过在 RVL-CDIP 基准上进行近端策略优化训练,DocHRL 在 16 个文档类别上达到了 0.973 的宏 F1 分数,同时将每个文档的平均成本降低到 2.74 个标准化单位,相较于固定独立分类器的显著更高费用。

我们的结果表明,基于成本的强化学习可以同时提高分类性能和文档理解系统的运营效率。

博主点评: DocHRL 的创新之处在于其层次化的策略选择机制,充分利用了强化学习的优势,提升了文档分类的效率与经济性。该框架不仅关注分类准确性,还将成本控制纳入考量,展示了在实际应用中的潜力。

原文链接: https://arxiv.org/abs/2607.22644

[h] 返回首页