生成式 AI 工作负载的智能内容摄取系统旨在将内容抽取提升为独立的生命周期阶段。传统机器学习任务、数据表示、标签和模型结构紧耦合,导致数据准备受限且可见;而生成式 AI 将模型与单一任务解耦,单一基础模型支撑开放式下游任务,随之而来的是企业知识以 PDF、演示文稿、电子表格、扫描件、表单、表格、图示等混合布局形式出现,包含文本、视觉、几何和结构信息。语言模型或检索器在这些信息被错误表示时难以可靠推理,因此必须在前端进行精准的内容抽取。
本文提出的生产级抽取系统包括选择性 OCR 路由、稀缺优先的策展引擎、基于参考的抽取评分器以及确定性的结构感知父子块划分器,还配备只读检索评估器。评分器分别衡量字符、词汇和表格结构的准确率;块划分器在保持层次结构的同时生成检索单元;评估器为每页生成有依据的问题并统计 Hit@k、平均倒数排名和延迟。
在 180 篇文档的实验中,最佳抽取器的综合得分为 97.4(字符错误率 0.13%,表格相似度 0.995),块划分器在 25,050 条生成问题上实现 Hit@1 68.6%,Hit@10 92.8%,MRR 0.77。我们归纳出三条设计原则:先构建结构后处理语义、测量即不变、更合理地分配标注预算,并将可测量的内容抽取视为企业智能体系统的感知层。点评