扫描邮件、上传的 PDF 或合并的附件常以页流形式出现,需要在后续的分类、抽取或路由之前拆分为单独文档。零样本大语言模型(LLM)能够在无需任务特定训练的情况下检测文档边界,但传统的页分类(PC)和边界决策(BD)每次调用只能决定一个边界,导致推理请求数量庞大。
本文提出 多边界分割决策(MSBD),在一次模型调用中对一个页窗口内的多个潜在边界 simultaneously 进行预测,从而显著降低推理请求次数。我们在多种语言模型、文档集合、输入模态以及不同窗口大小下对 MSBD 进行评估。
实验结果显示,存在模型和语料库依赖的可操作窗口范围:在该范围内,MSBD 能保持与单边界方法相近的分割准确率,同时大幅提升推理效率;超出该范围后,准确率出现急剧下降。更大窗口会导致不同模型出现明显的过度分割或不足分割行为。
综合来看,MSBD 在整体准确率‑效率权衡上表现最佳,只要为目标语料库选取合适的窗口大小,多边界预测即可使零样本页流分割更高效。
点评