NeFut Logo NeFut
EN 管理员登录

[AI学术] 让每一次工具调用都有价值:面向具身视觉语言模型的必要工具-证据路径奖励

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #Neural

现代视觉语言模型(VLM)能够直接回答许多基于图像的问题,但在需要细粒度视觉细节或外部知识的复杂查询上仍表现不足。为获取缺失的证据,具身 VLM 会调用图像裁剪、图像搜索、文本搜索等工具。然而,现有训练范式主要依据最终答案的正确性来评估工具使用,导致证据获取和利用缺乏监督。于是出现两个主要问题:

  1. 模型经常发出冗余或偏离目标的工具调用,未能收集到必要证据;
  2. 即使调用了合适的工具,模型也常未能从观察结果中提取所需信息。

为了解决这些问题,本文提出 必要工具-证据路径(NTEP) 注释方案,明确每个查询所需的外部证据及对应的工具调用。基于 NTEP,进一步设计 NTEP‑R(NTEP Reward) 监督机制,确保每一次工具调用都严格推动推理过程向最终解答前进。具体做法是:奖励模型在调用前的意图与必要证据搜索目标对齐,并奖励从调用后观察中总结的信息与必要证据相匹配。与此同时,引入 非重复目标正则化器,对重复访问已满足 NTEP 目标的调用进行惩罚。

在七个图像‑基准测试上,8B 参数的实现 NTEP‑8B 在搜索导向的准确率和工具使用效率上均取得显著提升,且仅使用了裁剪、搜索、文本三种工具的统一框架。实验结果表明,细粒度的工具‑证据路径监督对训练稳健的具身 VLM 至关重要。

点评

原文链接: https://arxiv.org/abs/2609.03493

[h] 返回首页