NeFut Logo NeFut
EN 管理员登录

[AI学术] DocMIDE:学习视觉丰富文档中的多跳隐式推导

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

现实中的文档处理系统往往依赖固定的模式,但关键字段常常没有直接的视觉对应,需要通过多跳推导才能得到,例如对子类目求和或对视觉标记进行推理。现有方法只能处理显式文本片段或单步隐式查询,在多跳视觉推理上表现不佳:模型要么检索到错误的视觉证据,要么即使检索正确也直接跳过中间推导步骤。

为了解决这一问题,我们提出了 DocMIDE——一种微调框架,训练紧凑的视觉语言模型在生成答案前显式检索视觉证据。DocMIDE 将生成过程约束为“计划‑检索‑推导”三阶段,并使用基于四要素的规则奖励(输出格式、检索到的证据块、每一步中间推导、最终答案)在 Group Relative Policy Optimization 下进行优化。

在 4,151 对隐式抽取基准上,DocMIDE 将 Qwen3.5-4B 的准确率从 70.8% 提升至 95.9%,仅使用少量标注示例,并且能够迁移到另一种骨干网络。仅靠监督示例无法弥合差距,关键在于对中间步骤进行奖励。

点评

原文链接: https://arxiv.org/abs/2609.24092

[h] 返回首页