视觉语言模型在处理图像中的异常文本时,往往会将其改写为语言上合理的表达,从而削弱 OCR 转录的忠实性。序列层面的任务奖励与局部教师引导是互补的,但同一教师的指导在学生性能提升时并不总是同等有效。离线分析表明,固定教师的监督随着学生在不同训练检查点以及不同任务奖励响应组的提升而逐渐失效。基于此观察,我们提出 GAD‑RL,它在联合后训练阶段根据学生当前的任务表现和局部分布自适应调节教师监督。冻结的教师以参考转录和学生生成的前缀为条件。GAD‑RL 对任务奖励≥0.95 的响应组关闭蒸馏,并随组均值奖励的提升持续衰减蒸馏强度。同时,前向 KL 乘以学生对教师 Top‑1 令牌的概率,以在学生对该候选支持度低时抑制局部辅助更新。实验在 Qwen3.5‑2B 上进行,GAD‑RL 在 CHAOS‑Bench 上实现 59.92% 的 Micro Recall,分别比 GRPO 和 GRPO+OPD(固定权重)高出 8.45 和 4.43 个百分点,并在 OmniDocBench v1.6 上取得 91.18 的 Overall 分数。
点评