现代视觉语言模型(VLM)能够直接回答许多基于图像的问题,但在需要细粒度视觉细节或外部知识的复杂查询上仍表现不足。为获取缺失的证据,具身 VLM 会调用图像裁剪、图像搜索、文本搜索等工具。然而,现有训练范式主要依据最终答案的正确性来评估工具使用,导致证据获取和利用缺乏监督。于是出现两个主要问题:
- 模型经常发出冗余或偏离目标的工具调用,未能收集到必要证据;
- 即使调用了合适的工具,模型也常未能从观察结果中提取所需信息。
为了解决这些问题,本文提出 必要工具-证据路径(NTEP) 注释方案,明确每个查询所需的外部证据及对应的工具调用。基于 NTEP,进一步设计 NTEP‑R(NTEP Reward) 监督机制,确保每一次工具调用都严格推动推理过程向最终解答前进。具体做法是:奖励模型在调用前的意图与必要证据搜索目标对齐,并奖励从调用后观察中总结的信息与必要证据相匹配。与此同时,引入 非重复目标正则化器,对重复访问已满足 NTEP 目标的调用进行惩罚。
在七个图像‑基准测试上,8B 参数的实现 NTEP‑8B 在搜索导向的准确率和工具使用效率上均取得显著提升,且仅使用了裁剪、搜索、文本三种工具的统一框架。实验结果表明,细粒度的工具‑证据路径监督对训练稳健的具身 VLM 至关重要。
点评