NeFut Logo NeFut
EN 管理员登录

[AI学术] 正确的信息抽取流水线取决于文档:小型本地模型的准确性‑能耗权衡

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #optimization

是否应在信息抽取流水线中处理页面图像还是已解析文本取决于文档类型,且在布局丰富度上会出现相反的结论。我们在排除(闭源)云服务的前提下,研究了该权衡:对隐私敏感文档在本地使用参数不超过 8 B 的文本模型和视觉‑语言模型进行处理,分别在准确率和能耗上进行评估,考察的设计空间包括输入表示、模型族和推理配置。基准测试选取了近乎纯文本的 Kleister‑NDA 合同和布局丰富的 VRDU 表单。实验表明,批处理是最主要的能耗杠杆,能够在不牺牲准确率的前提下降低每页能耗 38‑85%。FP8 量化在单请求情况下可节省 27‑32% 能耗,但在批处理后每页节省不足 1 mWh(约 9‑19%)。在剩余能耗中,预处理占比最高:神经 OCR 的每页能耗是传统 OCR 的 17 倍,且始终未能进入帕累托前沿。哪种表示方式更优随文档类型而变:布局丰富的文档使用视觉‑语言模型效果最佳;近乎纯文本的文档使用配合廉价解析器的小型文本模型更佳,两者在准确率和能耗上均优于任何视觉‑语言配置。基于此,我们给出了一套面向能效和隐私合规的本地信息抽取实践指南。

点评

原文链接: https://arxiv.org/abs/2609.31341

[h] 返回首页