NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆文档解析的OvisOCR2:一款全新0.8B模型的技术报告

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

OvisOCR2是一个设计为端到端解析器的0.8B文档解析模型。给定一个文档页面图像,它能够生成自然阅读顺序的Markdown表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,结合了经过筛选的真实文档注释和合成页面,这些页面的渲染图像和Markdown目标源自同一HTML源。

训练过程包括监督微调、在一个4B分支上进行的强化学习,设计了多组件奖励机制,并将学习的策略蒸馏到0.8B模型中,最后进行模型融合。在OmniDocBench v1.6上,OvisOCR2取得了96.58的整体最高分,成为这一领域的领先者,打破了以往由管道方法主导的局面,凸显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2同样表现优异,达到了75.06的最高Avg3分数。

除了这两个公共基准外,我们还在一个内部基准上评估了OvisOCR2,旨在覆盖更广泛的长尾和挑战性场景。OvisOCR2在比较方法中表现最佳,进一步证明了其泛化能力和鲁棒性。OvisOCR2的模型可在Hugging Face上获取。

博主点评: OvisOCR2的设计和训练方法展示了深度学习在复杂文档解析中的巨大潜力,尤其是其端到端的策略,显著提高了模型的通用性与鲁棒性,值得关注。其在多个基准测试中超越传统方法,标志着文档解析技术的新一轮突破。

原文链接: https://arxiv.org/abs/2607.13639

[h] 返回首页