现实中的文档处理系统往往依赖固定的模式,但关键字段常常没有直接的视觉对应,需要通过多跳推导才能得到,例如对子类目求和或对视觉标记进行推理。现有方法只能处理显式文本片段或单步隐式查询,在多跳视觉推理上表现不佳:模型要么检索到错误的视觉证据,要么即使检索正确也直接跳过中间推导步骤。
为了解决这一问题,我们提出了 DocMIDE——一种微调框架,训练紧凑的视觉语言模型在生成答案前显式检索视觉证据。DocMIDE 将生成过程约束为“计划‑检索‑推导”三阶段,并使用基于四要素的规则奖励(输出格式、检索到的证据块、每一步中间推导、最终答案)在 Group Relative Policy Optimization 下进行优化。
在 4,151 对隐式抽取基准上,DocMIDE 将 Qwen3.5-4B 的准确率从 70.8% 提升至 95.9%,仅使用少量标注示例,并且能够迁移到另一种骨干网络。仅靠监督示例无法弥合差距,关键在于对中间步骤进行奖励。
点评