摘要
历史满文OCR必须适应多种视觉上明显不同的书写风格,包括楷书、行书和用于宫廷奏折的半行草书,尽管标注数据有限。我们研究了一种多专家系统,该系统重用来自迭代微调过程的检查点作为领域专家,并使用轻量级的页面级图像分类器按视觉风格分派页面。
当检查点池中缺乏合适的专家时,我们为该领域训练了额外的专家。在三个冻结测试集上,该路由系统以两位小数精度匹配每种风格的选定专家:楷书的字符错误率(CER)为0.30%,奏折为1.57%,行书为4.83%。路由器实现了99.3%的页面级领域准确率,并以相同精度匹配领域标签的oracle。三位选定专家中有两位并非专门针对最终领域训练;只有行书专家是以该领域为目标进行训练的。
我们报告了评估协议、路由器设计和每页预测,以使比较可重复。
博主点评: 该研究展示了在资源受限的情况下,通过多专家系统有效地处理多样化书写风格的潜力,尤其是在历史文本的OCR任务中。利用检查点重用的策略,不仅提高了准确性,也为未来的低资源OCR领域提供了新的思路。