NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆传统思维:高效的多模态文档问答后训练方法

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

摘要

高效的多模态文档问答需要明确的视觉定位,即找到支持每个答案的确切文档区域,这仍然是一个开放的挑战。当前的方法主要分为两类:一类是监督细化(Supervised Fine-Tuning, SFT),需要大量标注数据并达到优化瓶颈;另一类是以推理为中心的强化学习(Reinforcement Learning, RL),依赖冗长的中间轨迹,导致推理令牌成本增加,但收益不明显。

我们提出了Perception-RFT,这是一个训练框架,应用群体相对策略优化(Group Relative Policy Optimization, GRPO)于多模态文档问答,跳过中间推理令牌,直接将视觉特征与结构化的基础输出对齐。为了严格评估推理的必要性,我们在相同奖励设置下构建了一个推理变体。

我们的研究发现,启用推理的模型在训练过程中抑制其推理轨迹,在4B参数规模下收敛到基于直接感知的策略,减少每个查询的推理令牌长度超过60%,而启用推理的RL表现不如仅基于感知的训练。通过对Qwen3-VL-4B优化动态的细致分析,我们确认SFT饱和和冷启动RL不稳定性在文本领域后训练中扩展到多模态,并识别出之前未描述的基础发散:在两个分布外(OOD)基准(4,828个样本)下,语义鲁棒性与几何精度之间的选择性权衡。

我们进一步展示,早期的SFT到RL的转变在训练数据减少65%的情况下可实现相似的精度。

博主点评: 本文提出的Perception-RFT框架通过减少推理令牌的使用,显著提高了多模态文档问答的效率,展示了直接感知的优势。这一研究不仅为后续的多模态问答系统设计提供了新思路,也为强化学习在复杂任务中的应用开辟了新的方向。通过优化策略的调整,研究者们有效地平衡了模型性能和资源消耗,值得进一步关注与探索。

原文链接: https://arxiv.org/abs/2607.14682

[h] 返回首页